{"as_of":"2026-08-05T18:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:94eb243e3ee00eafb42fc32172b792cbd448f76972365887387dfb6e9ea16205","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T18:23:30.681253Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T11:43:22.620353Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T05:59:37.208407Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"cited_work":{"arxiv_id":"2605.27295","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.27295","snapshot_observed_at":"2026-07-04T05:59:37.208407Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","venue":"cs.CV","work_id":"7804062a-08ef-4bdb-b5a6-a983f5ac5952","year":2026},"citing_paper":{"arxiv_id":"2606.11269","last_updated":"2026-06-09T06:38:36Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-06-09T06:38:36Z","title":"Traits Run Deeper: Trait-Specific Asymmetric Fusion for Personality Assessment","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T14:08:00.387995Z"},"links":{"cited_paper":"/paper/2605.27295","citing_paper":"/paper/2606.11269"},"observation_digest":"sha256:a97f2ac8373a3c76335352dab94aed386ee295b574b1d496392935a273110195","observation_id":"00cb9db0-bb9c-4779-b138-f5072ca87c96","resolution":{"observed_at":"2026-07-03T04:07:37.108120Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"cited_work":{"arxiv_id":"2605.27295","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.27295","snapshot_observed_at":"2026-07-04T05:59:37.208407Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","venue":"cs.CV","work_id":"7804062a-08ef-4bdb-b5a6-a983f5ac5952","year":2026},"citing_paper":{"arxiv_id":"2606.20898","last_updated":"2026-06-18T19:49:18Z","snapshot_observed_at":"2026-08-01T23:50:29.059546Z","submitted_at":"2026-06-18T19:49:18Z","title":"The Token Tax of Epistemic Accuracy: Comparing RAG and Long-Context Architectures for Document-Grounded Generative AI Applications","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T15:08:16.105336Z"},"links":{"cited_paper":"/paper/2605.27295","citing_paper":"/paper/2606.20898"},"observation_digest":"sha256:591de1e252ce602af5ff0f8c57052e30ab57ed7073e41c2c6df6d231b47f492d","observation_id":"00a20ab4-c19d-4a05-b381-d5bb9d3652b5","resolution":{"observed_at":"2026-07-04T05:59:37.210157Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27295","snapshot_observed_at":"2026-07-11T19:22:55.637577Z","title":"Shanbhogue, Z","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04410","last_updated":"2026-07-05T17:03:08Z","snapshot_observed_at":"2026-08-03T05:49:33.222053Z","submitted_at":"2026-07-05T17:03:08Z","title":"AI Wizards at EXIST 2026: Hierarchical Soft-Label Learning for Multimodal Sexism Identification in Memes","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T19:22:55.637577Z"},"links":{"cited_paper":"/paper/2605.27295","citing_paper":"/paper/2607.04410"},"observation_digest":"sha256:fb36a4dbaf97fd8655efaf427130e27925a871afeb463984e4924706ed605105","observation_id":"ac8ec57b-f516-4392-a998-a3e457e54e34","resolution":{"observed_at":"2026-07-11T19:22:55.637577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27295","snapshot_observed_at":"2026-07-31T03:59:33.933416Z","title":"https://arxiv.org/abs/2605.27295","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28550","last_updated":"2026-07-30T17:20:12Z","snapshot_observed_at":"2026-08-03T00:12:29.109482Z","submitted_at":"2026-07-30T17:20:12Z","title":"Correcting Mode Collapse in Silicon Sampling with Semantic Similarity Rating","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T03:59:33.933416Z"},"links":{"cited_paper":"/paper/2605.27295","citing_paper":"/paper/2607.28550"},"observation_digest":"sha256:b5912186c75be1434315430f62b895794cf46daf359d9a85b5daa4f4a1608c1c","observation_id":"404724dd-83f2-4b20-ab67-34c4e15f0bc6","resolution":{"observed_at":"2026-07-31T03:59:33.933416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27295","snapshot_observed_at":"2026-08-05T11:43:22.620353Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03826","last_updated":"2026-08-04T15:36:17Z","snapshot_observed_at":"2026-08-05T18:20:54.267123Z","submitted_at":"2026-08-04T15:36:17Z","title":"Geo-Embed: Towards Unified Multimodal Embeddings for Urban Understanding","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T11:43:22.620353Z"},"links":{"cited_paper":"/paper/2605.27295","citing_paper":"/paper/2608.03826"},"observation_digest":"sha256:eea24930428adf9cc541cf5275ef965035d962ded39210e57152e1be4e85ac4b","observation_id":"e83e423f-e064-4aec-96ef-b12ca0841479","resolution":{"observed_at":"2026-08-05T11:43:22.620353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.27295/citation-record","integrity":"/paper/2605.27295/integrity","json":"/paper/2605.27295/citation-record.json","paper":"/paper/2605.27295"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:23:30.681253Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:79784cc61e14c7a851b90a23ceab1fed8214b1ec946cd399106cdc36059c57b4","observation_id":"f41fbdb9-6d8a-42a2-8ef9-24b2bd34737f","resolution":{"observed_at":"2026-06-29T18:23:30.681253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:23:30.681253Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:37913673d2f418a317bcb85549c5e512084a06a3462081304dce50574ac99645","observation_id":"e7fac238-a33c-465b-b7e1-fe1da02bc226","resolution":{"observed_at":"2026-06-29T18:23:30.681253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:23:30.681253Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding.Localization, and Dense Features, 6, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:07b202e9c99de8d74f28e965beabcf50b9341bd9756c4699f01f7186ba081221","observation_id":"213cdbed-22de-468e-a95d-2280f227c02e","resolution":{"observed_at":"2026-06-29T18:23:30.681253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":"2205.01917","doi":"10.48550/arxiv.2205.01917","metadata_source":"pith","pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","venue":"cs.CV","work_id":"5dd5bf10-d548-40ff-9b6c-6735129b27ee","year":2022},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:31e91f28bfef4f021225b279a53c560c0db6e918f8fea0d08243841dfb1b4323","observation_id":"e13f9415-5761-4104-9d7a-8442f5c2f5f8","resolution":{"observed_at":"2026-06-29T18:23:50.303603Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:43.398968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:43.398968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:8c189b53e2afee41608f0f93e1d893c8d9edccdbfe83f7ae22036921c406bedb","observation_id":"5ffa7425-b8cb-455a-b801-b0885c98c391","resolution":{"observed_at":"2026-06-29T18:23:50.296135Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:23:30.681253Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks.Advances in neural information processing systems, 33:9459–9474, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:207743b3f43c63755fb16a55d30954a781c950f9b8d951523cec71f55f574780","observation_id":"4f7dc28a-ebe6-45f4-820b-f073e503127f","resolution":{"observed_at":"2026-06-29T18:23:30.681253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.13595","doi":"10.48550/arxiv.2502.13595","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.13595 , year=","venue":"ArXiv.org","work_id":"774aa5f1-35ad-4b36-b6cc-5f461cfab347","year":2025},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:d661324767688005e9f92df1b63f17c3a941e28194f0a13d1f6f304c3161d0ea","observation_id":"3a88d700-ef09-4f06-8da0-2b5d972c9736","resolution":{"observed_at":"2026-06-29T18:23:50.289872Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T01:21:22.576282+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T01:21:22.576282+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:f57b0fd4d46d6e818165746c226fa57825f6f64c89ccfc84d0a1ec16d83ca1d3","observation_id":"56d20cda-a9d5-4452-810a-7713d314e434","resolution":{"observed_at":"2026-06-29T18:23:50.333638Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04870","last_updated":"2016-09-19T20:20:42Z","snapshot_observed_at":"2026-08-03T10:48:50.688044Z","submitted_at":"2015-05-19T04:46:03Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","version":4},"cited_work":{"arxiv_id":"1505.04870","doi":null,"metadata_source":"pith","pith_arxiv_id":"1505.04870","snapshot_observed_at":"2026-07-04T16:29:57.874633Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","venue":"cs.CV","work_id":"7b107a59-1658-40dc-9893-3297124c3ed9","year":2015},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"cited_paper":"/paper/1505.04870","citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:2f4567044e6d1f00bede9ad16ee94163fc1897b01802800005e6b0be6e204f9c","observation_id":"7cd2decd-4774-4b03-8060-2878214813bf","resolution":{"observed_at":"2026-06-29T18:23:50.301057Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:23:30.681253Z","title":"Msr-vtt: A large video description dataset for bridging video and language.2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pages 5288–5296, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:7b289e4be67cfd3ec1468bed77aa8d6427065a7f4d3127394e6dd475a70f8a28","observation_id":"7c777efa-e00a-4993-a633-bf788410d03c","resolution":{"observed_at":"2026-06-29T18:23:30.681253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:23:30.681253Z","title":"BERT: pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:c6438a308664adc45279b308fb3c77bc20fc82bef37facbecb265dfa4f501940","observation_id":"d742cfc9-1ded-4ebf-89d7-67f3f55df680","resolution":{"observed_at":"2026-06-29T18:23:30.681253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":"1907.11692","doi":"10.1007/s10489-02203627-9","metadata_source":"pith","pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","venue":"cs.CL","work_id":"41fe12c4-e538-4890-a244-480650ed3078","year":2019},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:fbc5dd21f9ca85ebb068fe7ba4a1a13231c740507c9bc3fa67a4bbc07a581683","observation_id":"ce743864-dc51-4c9f-b3bf-ad10024c35a8","resolution":{"observed_at":"2026-06-29T18:23:50.326043Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03216","last_updated":"2025-12-12T11:26:32Z","snapshot_observed_at":"2026-07-06T17:25:35.493362Z","submitted_at":"2024-02-05T17:26:49Z","title":"M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation","version":5},"cited_work":{"arxiv_id":"2402.03216","doi":"10.48550/arxiv.2402.03216","metadata_source":"pith","pith_arxiv_id":"2402.03216","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation","venue":"cs.CL","work_id":"a9435752-4e49-42bd-95b4-0fec975633c8","year":2024},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"cited_paper":"/paper/2402.03216","citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:043354757742740c5657a0b9c28d46b368ae062275debc39f38ffa0dc8bc698d","observation_id":"e651c241-d03a-43de-8583-23768ff10d9a","resolution":{"observed_at":"2026-06-29T18:23:50.353685Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03533","last_updated":"2024-02-22T06:21:51Z","snapshot_observed_at":"2026-07-06T14:27:46.217000Z","submitted_at":"2022-12-07T09:25:54Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","version":2},"cited_work":{"arxiv_id":"2212.03533","doi":"10.48550/arxiv.2212.03533","metadata_source":"pith","pith_arxiv_id":"2212.03533","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","venue":"cs.CL","work_id":"789cc674-467e-4f23-bb50-05c79fe8c4c2","year":2022},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"cited_paper":"/paper/2212.03533","citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:1f4d0d7abf048f0351428e2725e859b988d5a2a055bd26043c16997883637c78","observation_id":"3ba63fe9-b520-487e-b783-ea1ad1556357","resolution":{"observed_at":"2026-06-29T18:23:50.328654Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T10:08:09.486841+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T10:08:09.486841+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20327","last_updated":"2024-03-29T17:56:40Z","snapshot_observed_at":"2026-07-06T17:53:11.000124Z","submitted_at":"2024-03-29T17:56:40Z","title":"Gecko: Versatile Text Embeddings Distilled from Large Language Models","version":1},"cited_work":{"arxiv_id":"2403.20327","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.20327","snapshot_observed_at":"2026-07-04T20:00:08.912981Z","title":"Zehan Li, Xin Zhang, Yanzhao Zhang, Dingkun Long, Pengjun Xie, and Meishan Zhang","venue":null,"work_id":"e7351286-ab67-4f70-a660-a2246bb5548d","year":2024},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"cited_paper":"/paper/2403.20327","citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:254d690e75a0dbcd9b1f5ef0371f6e996f771837979082a0aa7bcf7214613531","observation_id":"d52205b2-7714-43fc-b89d-24a46f94bb24","resolution":{"observed_at":"2026-06-29T18:23:50.284518Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17428","last_updated":"2025-02-25T00:35:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-27T17:59:45Z","title":"NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models","version":3},"cited_work":{"arxiv_id":"2405.17428","doi":"10.48550/arxiv.2405.17428","metadata_source":"pith","pith_arxiv_id":"2405.17428","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models","venue":"cs.CL","work_id":"f8b6faa6-cb4e-4e31-95a5-6b8986c27baa","year":2024},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"cited_paper":"/paper/2405.17428","citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:55b61333dbcdfded6ec95ca7f7cb6ac9a1fe8beee9d81a78b005e73e27b0e31e","observation_id":"2ad044ba-680c-46fe-8b6a-01ce385dac3f","resolution":{"observed_at":"2026-06-29T18:23:50.306415Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:23:30.681253Z","title":"Mteb: Massive text embedding benchmark","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:52deed908a25bc6201351c5886e8f24241ef7d078084393261332e4021270bb3","observation_id":"d710f208-1463-4b5d-92ac-92e19ffe8607","resolution":{"observed_at":"2026-06-29T18:23:30.681253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07891","last_updated":"2025-03-10T22:16:45Z","snapshot_observed_at":"2026-07-06T20:50:19.098219Z","submitted_at":"2025-03-10T22:16:45Z","title":"Gemini Embedding: Generalizable Embeddings from Gemini","version":1},"cited_work":{"arxiv_id":"2503.07891","doi":"10.1162/tacl.a.18","metadata_source":"pith","pith_arxiv_id":"2503.07891","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini Embedding: Generalizable Embeddings from Gemini","venue":"cs.CL","work_id":"911b6918-a128-453f-ae99-94388c38fcb1","year":2025},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"cited_paper":"/paper/2503.07891","citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:90a300f36665e8c43599682abd671fb2485e2eef8fa890c43f6ec6d03d0ffad0","observation_id":"bba5a809-f0aa-4dfb-b96d-a0f6cd373c29","resolution":{"observed_at":"2026-06-29T18:23:50.344681Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.12709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T05:49:36.554602Z","title":"arXiv preprint arXiv:2510.12709 (2025) 2","venue":null,"work_id":"3e52354f-d186-44b5-8a9e-616b198dc195","year":2025},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:fcc7709609d8e7cc8af89245ad665f5dd679329ae38a32cee0ad1a1ee0c2fdb2","observation_id":"0c024d48-6300-4260-ad3f-66f8ef5c3d8e","resolution":{"observed_at":"2026-06-29T18:23:50.339280Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:23:30.681253Z","title":"Amazon nova multimodal embeddings: State-of-the-art embedding model for agentic rag and semantic search","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:3ca84fc45a8c9bbbd3ebc7f6db72f0853d0f3312be2bceb925bc4821ed41f005","observation_id":"84c08e4e-a02c-4620-b905-20489c6cdc01","resolution":{"observed_at":"2026-06-29T18:23:30.681253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-07-06T21:49:13.509342Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"cited_work":{"arxiv_id":"2506.23115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23115","snapshot_observed_at":"2026-07-02T07:26:45.637665Z","title":"Moca: Modality-aware continual pre-training makes better bidirectional multimodal embeddings","venue":null,"work_id":"c2a43a86-8991-44c1-9661-5f79becb3fc2","year":2025},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"cited_paper":"/paper/2506.23115","citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:8fad24a65aa9141f99481920437c60e7824c81ae84fb806c8b3abbc78328eeff","observation_id":"7ef45a18-3a16-4182-b019-468cb531e09f","resolution":{"observed_at":"2026-06-29T18:23:50.317846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02571","last_updated":"2025-02-22T05:33:26Z","snapshot_observed_at":"2026-08-05T15:40:56.242909Z","submitted_at":"2024-11-04T20:06:34Z","title":"MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2411.02571","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02571","snapshot_observed_at":"2026-07-04T15:49:57.631122Z","title":"arXiv preprint arXiv:2411.02571 , year=","venue":null,"work_id":"da61907d-fb9d-4f7b-a9bc-4750420fb05e","year":2024},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"cited_paper":"/paper/2411.02571","citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:05242e5569677b53b193f04c5188bfc417817ce152c58730c7ab4b53f7cd1889","observation_id":"dc643c07-c8c5-47a8-a898-d3d1f5ace4d0","resolution":{"observed_at":"2026-06-29T18:23:50.323587Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02656","last_updated":"2025-03-04T14:17:00Z","snapshot_observed_at":"2026-08-03T15:46:41.716130Z","submitted_at":"2025-03-04T14:17:00Z","title":"Adapting Decoder-Based Language Models for Diverse Encoder Downstream Tasks","version":1},"cited_work":{"arxiv_id":"2503.02656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.02656","snapshot_observed_at":"2026-06-29T18:23:50.349129Z","title":"Adapting decoder-based language models for diverse encoder downstream tasks, 2025","venue":null,"work_id":"32109f7e-4006-4625-81e3-1e0b5f9a5b29","year":2025},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"cited_paper":"/paper/2503.02656","citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:def90ea66ba9908a2dc3effa625c67b8da126039f9aa781cddf504670cfe962f","observation_id":"03687859-8d4e-430f-a72f-9b69413fbeb8","resolution":{"observed_at":"2026-06-29T18:23:50.350783Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":"1807.03748","doi":"10.1609/aaai.v36i10.21390","metadata_source":"pith","pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Learning with Contrastive Predictive Coding","venue":"cs.LG","work_id":"7b08a1d4-d565-424e-9c86-6ef244b7b90a","year":2018},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:4a38e5ae1febcbdf4ac202c0c0ac1ad573d976ab59fd8b59c5fa63fe40ba9836","observation_id":"8422d2df-a23c-4a7a-af62-5ea36896a9f4","resolution":{"observed_at":"2026-06-29T18:23:50.298511Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:23:30.681253Z","title":"Matryoshka representation learning.Advances in Neural Information Processing Systems, 35:30233–30249, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:f4a486fc32ad59455fa5af46806b6a1a83afd996f1565ab4cf4f79a6891cbcf6","observation_id":"334b8734-373d-41bd-bd77-5439f0bd8a97","resolution":{"observed_at":"2026-06-29T18:23:30.681253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05407","last_updated":"2019-02-25T14:18:11Z","snapshot_observed_at":"2026-07-31T19:09:21.589864Z","submitted_at":"2018-03-14T17:09:27Z","title":"Averaging Weights Leads to Wider Optima and Better Generalization","version":3},"cited_work":{"arxiv_id":"1803.05407","doi":"10.48550/arxiv.1803.05407","metadata_source":"pith","pith_arxiv_id":"1803.05407","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Averaging Weights Leads to Wider Optima and Better Generalization","venue":"cs.LG","work_id":"a7c6bded-245c-4243-8969-f16b6ac407ba","year":2018},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"cited_paper":"/paper/1803.05407","citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:f1bc0797f81b521066b15dc6d75e18978c034247592aa2242c502810fc7169c3","observation_id":"db4929d4-fdfb-40b6-aae9-6d4454025633","resolution":{"observed_at":"2026-06-29T18:23:50.287012Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:53:38.184761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:53:38.184761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:23:30.681253Z","title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:4be71d814b37a41ea9923c51f494baa32646fcb4af067b356851be7ea4060489","observation_id":"34daf114-b575-4c37-a88d-5776a2211aab","resolution":{"observed_at":"2026-06-29T18:23:30.681253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:23:30.681253Z","title":"Introducing the google uni- versal image embedding challenge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:f8994093d9ca5066872bf88f26a5e5c5b56b3032cec83182a62f6c4e752e4240","observation_id":"30204292-9702-4283-8913-7ec4349a7b9d","resolution":{"observed_at":"2026-06-29T18:23:30.681253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2009.520684","doi":"10.1109/cvpr.2009.5206848","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"author Dong, W","venue":"2009 IEEE Conference on Computer Vision and Pattern Recognition","work_id":"effdb28b-742e-4840-b3ca-d89502a6cd4d","year":2009},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:7e4adbd200fe163cb18f4f6d1d907fd240971e5fa432eff041f7382c8d855181","observation_id":"127b89fe-f73c-4f12-99bb-77eb594c1e52","resolution":{"observed_at":"2026-06-29T18:23:50.165452Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T22:19:22.921889+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T22:19:22.921889+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19753","last_updated":"2024-04-30T17:56:24Z","snapshot_observed_at":"2026-07-06T18:07:47.744531Z","submitted_at":"2024-04-30T17:56:24Z","title":"DOCCI: Descriptions of Connected and Contrasting Images","version":1},"cited_work":{"arxiv_id":"2404.19753","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.19753","snapshot_observed_at":"2026-06-29T18:23:50.307986Z","title":"Docci: Descriptions of connected and contrasting images","venue":null,"work_id":"56da108a-173f-4538-a1e1-d9850e7ff243","year":2024},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"cited_paper":"/paper/2404.19753","citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:24c9d28fb622513ca5d1abfd2d99c41e31fe6d1ca209143af8d81238ae5fa5ad","observation_id":"3269f5d8-5b06-4512-80fc-667a87290235","resolution":{"observed_at":"2026-06-29T18:23:50.309525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-030-58536-5_44","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"TextCaps: A Dataset for Image Captioning with Reading Comprehension","venue":"Lecture notes in computer science","work_id":"b876ac8c-17d0-4bac-bdfa-44e82b4e0370","year":2020},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:2045e0fec18c12151ca6b6bf7a717344709a209305139e7df4f4512624878921","observation_id":"1bce227a-59d6-415e-b499-4256eaefe95c","resolution":{"observed_at":"2026-06-29T18:23:50.160109Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.03493","last_updated":"2020-06-17T16:47:55Z","snapshot_observed_at":"2026-07-06T07:44:22.172601Z","submitted_at":"2019-04-06T16:50:31Z","title":"VATEX: A Large-Scale, High-Quality Multilingual Dataset for Video-and-Language Research","version":3},"cited_work":{"arxiv_id":"1904.03493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.03493","snapshot_observed_at":"2026-06-29T18:23:50.340475Z","title":"Vatex: A large-scale, high-quality multilingual dataset for video-and-language research, 2020","venue":null,"work_id":"d5a105b5-62c9-4649-b9aa-7cd423c52a0f","year":2020},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"cited_paper":"/paper/1904.03493","citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:211c22a84353045a6ee6826e44205233db1907c63d20bf931252407e8f453aab","observation_id":"38df4655-2de9-4185-9099-1b5ea4b23d27","resolution":{"observed_at":"2026-06-29T18:23:50.342053Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.09788","last_updated":"2017-11-21T20:37:43Z","snapshot_observed_at":"2026-07-06T05:35:35.581300Z","submitted_at":"2017-03-28T20:28:52Z","title":"Towards Automatic Learning of Procedures from Web Instructional Videos","version":3},"cited_work":{"arxiv_id":"1703.09788","doi":null,"metadata_source":"pith","pith_arxiv_id":"1703.09788","snapshot_observed_at":"2026-07-02T22:37:25.673735Z","title":"Towards Automatic Learning of Procedures from Web Instructional Videos","venue":"cs.CV","work_id":"93b8d7aa-ea58-4879-80d2-e4f91605aa5f","year":2017},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"cited_paper":"/paper/1703.09788","citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:92961ca76e4593b837b5b299709eabd26a497bc03aef6ced9292786c417476df","observation_id":"f534cd35-885a-48bd-949a-f64023e4143b","resolution":{"observed_at":"2026-06-29T18:23:50.311975Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:23:30.681253Z","title":"Encyclopedic vqa: Visual questions about detailed properties of fine-grained categories","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:92e1f9246ef7cf2687e712ecee1b14ddd885e4f02fab62ecc24da4df14e4dea5","observation_id":"bc15209d-c146-4a70-8b1d-5e164b8b9d4e","resolution":{"observed_at":"2026-06-29T18:23:30.681253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.17166","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:35:34.404348Z","title":"Vidore benchmark v2: Raising the bar for visual retrieval","venue":null,"work_id":"150178f5-a7c1-4213-aa52-c524dfc02964","year":2025},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:556947b427a32ebb0decbf2748c197fff610738a3388d2df6ce51fdeb1a071f6","observation_id":"2a0846f5-b618-4c4c-b5b9-924da8970d6a","resolution":{"observed_at":"2026-06-29T18:23:50.320704Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:23:30.681253Z","title":"Voyage multimodal 3.5","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:e340dc995554703dffefd600495e584865fe49a33a1bab8d17c3f3b730bc3bbc","observation_id":"c0b38e93-8fe6-477b-9f06-777a70241b14","resolution":{"observed_at":"2026-06-29T18:23:30.681253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:23:30.681253Z","title":"Multimodal embeddings API","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:ec8271d448e90c9f777c9981d0aaed306928e803371e87e03f227e416f16d848","observation_id":"40102aaa-6fa9-4226-99ac-3cf50918c7d1","resolution":{"observed_at":"2026-06-29T18:23:30.681253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:23:30.681253Z","title":"Google universal image embedding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:3e46f925aeac28390ed3f3b61c02af61e7e490e07938ace152f2512eb0335d14","observation_id":"5298879f-654e-4063-8c00-c3f3a4b1dfeb","resolution":{"observed_at":"2026-06-29T18:23:30.681253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:23:30.681253Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:782d3c2f4d18d3bcfcc1112c49f3ee4f1f9434d4698868861ee9da96a62747b8","observation_id":"b7fefc0c-c373-46c0-ae36-a56182e55700","resolution":{"observed_at":"2026-06-29T18:23:30.681253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02883","last_updated":"2025-06-06T03:39:22Z","snapshot_observed_at":"2026-07-06T18:40:48.783743Z","submitted_at":"2024-07-03T07:58:20Z","title":"CoIR: A Comprehensive Benchmark for Code Information Retrieval Models","version":3},"cited_work":{"arxiv_id":"2407.02883","doi":"10.48550/arxiv.2407.02883","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.02883","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tianyang Liu, Canwen Xu, and Julian McAuley","venue":"arXiv (Cornell University)","work_id":"962bdf9a-d746-425a-8285-7097e3d3ade9","year":2024},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"cited_paper":"/paper/2407.02883","citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:5292c382da6dc811ed273e7bf50de4726fd73e2445bcfb5a41dc8c2443df49c3","observation_id":"d99d0576-0d7a-4a9f-8708-0057fb070238","resolution":{"observed_at":"2026-06-29T18:23:50.292747Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T21:53:09.80985+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T21:53:09.80985+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.07143","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:23:50.329920Z","title":"Massive sound embedding benchmark (mseb), 2026","venue":null,"work_id":"421f20c6-bcb4-4cb5-b265-47d8e9521d6c","year":2026},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:0a0576a8a45d50c47df38bdc5799a79015f7bc57070494340669dd591cf519c2","observation_id":"62109dfa-d410-4f52-b3e8-71c70c08b56f","resolution":{"observed_at":"2026-06-29T18:23:50.331337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:23:30.681253Z","title":"Microvqa: A multimodal reasoning benchmark for microscopy-based scientific research","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:160ebe04e6f041cb906c9f5e29a3bf5d69e218ae9403f8201a4fc0f370312a28","observation_id":"47673b0a-9f6b-4a96-a8a9-c3290244c129","resolution":{"observed_at":"2026-06-29T18:23:30.681253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:23:30.681253Z","title":"Artcap: A dataset for image captioning of fine art paintings.IEEE Transactions on Computational Social Systems, 11(1):576–587, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:07619fe8b2deef8a36b0357f91b464d73755b7a354a2c36e89e90e0317f4aa90","observation_id":"d96bfdf5-0b7f-4955-b849-53ae9f7e01dd","resolution":{"observed_at":"2026-06-29T18:23:30.681253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08583","last_updated":"2025-04-11T14:36:31Z","snapshot_observed_at":"2026-07-06T21:07:56.643874Z","submitted_at":"2025-04-11T14:36:31Z","title":"AstroLLaVA: towards the unification of astronomical data and natural language","version":1},"cited_work":{"arxiv_id":"2504.08583","doi":"10.48550/arxiv.2504.08583","metadata_source":"pith","pith_arxiv_id":"2504.08583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AstroLLaVA: towards the unification of astronomical data and natural language","venue":"astro-ph.IM","work_id":"9145fe47-0c8d-4e6d-972d-2ff41c8d1bee","year":2025},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"cited_paper":"/paper/2504.08583","citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:b34de72aec6c4dea94448ec887f9175f23e30fb5f28687a93f96903796ee5352","observation_id":"15f4af27-8fe3-42f4-96f2-0a4e65a08b7f","resolution":{"observed_at":"2026-06-29T18:23:50.347887Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.270712+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.270712+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:23:30.681253Z","title":"Recipe1m+: A dataset for learning cross-modal embeddings for cooking recipes and food images.IEEE Transactions on Pattern Analysis and Machine Intelligence, 43(1):187–203, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:3f4838dad81bd4901048d37be341796a4b5fc5d5baad1c304407cf86d2d9d855","observation_id":"915b2211-651a-4a3e-a19e-67a44cf31621","resolution":{"observed_at":"2026-06-29T18:23:30.681253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16512","last_updated":"2025-03-07T19:38:42Z","snapshot_observed_at":"2026-08-03T16:54:44.297715Z","submitted_at":"2024-10-21T21:05:04Z","title":"TIPS: Text-Image Pretraining with Spatial awareness","version":2},"cited_work":{"arxiv_id":"2410.16512","doi":"10.48550/arxiv.2410.16512","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.16512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tips: Text-image pretraining with spatial awareness.arXiv preprint arXiv:2410.16512","venue":"arXiv (Cornell University)","work_id":"6827f81b-625a-4a2b-9237-e3b2e6978069","year":2025},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"cited_paper":"/paper/2410.16512","citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:45a4f63f99b156f5bacbf6e02df3df2fc789f7481a65497e3b97edf38bedb638","observation_id":"ee8dc2f1-8720-4862-87a8-d8a4171b509c","resolution":{"observed_at":"2026-06-29T18:23:50.314604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:23:30.681253Z","title":"Opencodeinterpreter: Integrating code generation with execution and refinement,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:7b15adb023829f426b0baf3d876c1abb595a7150206adb596c93c8d93251ea52","observation_id":"aa90389d-2a0e-4e6e-a67e-dcf99a679f1d","resolution":{"observed_at":"2026-06-29T18:23:30.681253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14658","last_updated":"2025-01-07T05:37:04Z","snapshot_observed_at":"2026-08-04T21:04:41.196171Z","submitted_at":"2024-02-22T16:06:23Z","title":"OpenCodeInterpreter: Integrating Code Generation with Execution and Refinement","version":3},"cited_work":{"arxiv_id":"2402.14658","doi":"10.48550/arxiv.2402.14658","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14658","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zheng, G","venue":"arXiv (Cornell University)","work_id":"33ce30ad-2fef-4b56-8636-c3b53b9dfd5b","year":2024},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"cited_paper":"/paper/2402.14658","citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:2e399c1fd60f24171517e687bea852b2cd8c919fbc54721fe2fa183a6226c3c8","observation_id":"a3b673c5-9590-426d-aa02-a43b1018e3b7","resolution":{"observed_at":"2026-06-29T18:23:50.336541Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:23:30.681253Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:fed91dca6eeaf4582dcb2a0aa735e8aca587dc0e402e24d528b336b4b2b20b2f","observation_id":"4eecb4c8-6f00-46e7-99ed-566dcd2f5c26","resolution":{"observed_at":"2026-06-29T18:23:30.681253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:23:30.681253Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:30.681253Z"},"links":{"citing_paper":"/paper/2605.27295"},"observation_digest":"sha256:625e2ea068cd35dc1bb62c1526fe48480e3e88491ac26a87c2b74b5d1b55e4d6","observation_id":"b184677e-fcf6-494f-875f-104ef8ef4b6c","resolution":{"observed_at":"2026-06-29T18:23:30.681253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.27295","last_updated":"2026-05-26T17:07:55Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T02:31:44.388877Z","submitted_at":"2026-05-26T17:07:55Z","title":"Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":22,"verified_exact":22,"verified_fuzzy":0},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 5 inbound Pith citation observations for arXiv:2605.27295."}