{"as_of":"2026-08-08T04:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1ccee997201631c5af0353814d7bc5ae6cc4dbebe3969e552dbfdbfe5e6882b0","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:22:35.866665Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T07:35:07.825460Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T07:35:28.745644Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"cited_work":{"arxiv_id":"2509.01644","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01644","snapshot_observed_at":"2026-07-01T07:35:28.745644Z","title":"InInternational Conference on Multimedia","venue":null,"work_id":"5ae95e10-5d91-4826-ab1d-e5970fd10064","year":2025},"citing_paper":{"arxiv_id":"2505.20638","last_updated":"2026-04-09T22:24:30Z","snapshot_observed_at":"2026-07-06T21:31:02.262018Z","submitted_at":"2025-05-27T02:31:24Z","title":"Music Audio-Visual Question Answering Requires Specialized Multimodal Designs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T14:11:52.011626Z"},"links":{"cited_paper":"/paper/2509.01644","citing_paper":"/paper/2505.20638"},"observation_digest":"sha256:a94ae612665b06ce98c79229e952ad320d40677065b976706f676cc8c4fb3539","observation_id":"d54b4bd1-d104-473b-9408-1017bb394642","resolution":{"observed_at":"2026-05-19T14:12:22.099238Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"cited_work":{"arxiv_id":"2509.01644","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01644","snapshot_observed_at":"2026-07-01T07:35:28.745644Z","title":"InInternational Conference on Multimedia","venue":null,"work_id":"5ae95e10-5d91-4826-ab1d-e5970fd10064","year":2025},"citing_paper":{"arxiv_id":"2604.08644","last_updated":"2026-04-09T17:51:11Z","snapshot_observed_at":"2026-08-02T14:49:38.234793Z","submitted_at":"2026-04-09T17:51:11Z","title":"EXAONE 4.5 Technical Report","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T17:47:34.692414Z"},"links":{"cited_paper":"/paper/2509.01644","citing_paper":"/paper/2604.08644"},"observation_digest":"sha256:f7c5f531f3ac2ddac1807346f36f2161ac8315eaac421489cf5e2f920f3acd0c","observation_id":"ceff4272-2fc6-4feb-aacd-0a7e9e4d51ac","resolution":{"observed_at":"2026-05-11T06:10:57.643157Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"cited_work":{"arxiv_id":"2509.01644","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01644","snapshot_observed_at":"2026-07-01T07:35:28.745644Z","title":"InInternational Conference on Multimedia","venue":null,"work_id":"5ae95e10-5d91-4826-ab1d-e5970fd10064","year":2025},"citing_paper":{"arxiv_id":"2605.00809","last_updated":"2026-06-09T13:08:44Z","snapshot_observed_at":"2026-08-02T08:22:53.063329Z","submitted_at":"2026-05-01T17:51:38Z","title":"Let ViT Speak: Generative Language-Image Pre-training","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-09T18:56:51.627714Z"},"links":{"cited_paper":"/paper/2509.01644","citing_paper":"/paper/2605.00809"},"observation_digest":"sha256:4d7ce6042ebfcc593e74e6e85cc23f4d516eafd6ff2a7d3b69a7ba34ef4f1381","observation_id":"b2aebc1d-71bf-4d4c-9d10-796e6daf5d92","resolution":{"observed_at":"2026-05-11T16:01:09.608761Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"cited_work":{"arxiv_id":"2509.01644","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01644","snapshot_observed_at":"2026-07-01T07:35:28.745644Z","title":"InInternational Conference on Multimedia","venue":null,"work_id":"5ae95e10-5d91-4826-ab1d-e5970fd10064","year":2025},"citing_paper":{"arxiv_id":"2605.00809","last_updated":"2026-06-09T13:08:44Z","snapshot_observed_at":"2026-08-02T08:22:53.063329Z","submitted_at":"2026-05-01T17:51:38Z","title":"Let ViT Speak: Generative Language-Image Pre-training","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-01T07:35:07.825460Z"},"links":{"cited_paper":"/paper/2509.01644","citing_paper":"/paper/2605.00809"},"observation_digest":"sha256:a185586ed62dfdec02fb1bf6a6a9a874e456abbc0ab93bf3b81347a0981b550d","observation_id":"872b850a-b17a-41ea-a8c2-cce065bdfcc7","resolution":{"observed_at":"2026-07-01T07:35:28.747148Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.01644/citation-record","integrity":"/paper/2509.01644/integrity","json":"/paper/2509.01644/citation-record.json","paper":"/paper/2509.01644"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:31.971104Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:31.971104Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:b08da2662c1f763d87a6bde3a735f41fca7162c1a7717389b45f07eb4e53f107","observation_id":"04be0f62-5e78-4fb7-a8dd-7e5e6a24ee74","resolution":{"observed_at":"2026-08-05T12:22:31.971104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:38.047350Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":"9e3913dc-0940-46a9-9921-a83040c5ef3d","year":1901},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:32.052551Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:96e14c96113df312107e825cedef7d7891c3c205b51a519dc6db013d5632289e","observation_id":"9aac679f-1a31-42c2-92f5-b743f973cc60","resolution":{"observed_at":"2026-08-05T12:22:38.058829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:37.995623Z","title":"Open-llava-next: An open- source implementation of llava-next series for facilitating the large multi-modal model community","venue":null,"work_id":"424bad20-d111-4a93-bb75-7d3925fafc11","year":2024},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:32.154735Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:2c6d1c2473666794722b60a201d3ffa4c5bdbae525a8b961853cd68fef01ccd7","observation_id":"5add7096-c187-495c-85b7-1c4837441c51","resolution":{"observed_at":"2026-08-05T12:22:38.013965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:37.969799Z","title":"Generative pre- training from pixels","venue":null,"work_id":"68dec2f2-d530-4130-8a2e-4f2d57167121","year":2020},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:32.257335Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:f4a2876d29e96c8026a1787d4dd3526a995a75296198f0b6423879066b850412","observation_id":"abb71275-78ed-4e94-a184-7080bc75fb7f","resolution":{"observed_at":"2026-08-05T12:22:37.975688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18565","last_updated":"2023-05-29T18:58:38Z","snapshot_observed_at":"2026-08-07T07:27:51.369423Z","submitted_at":"2023-05-29T18:58:38Z","title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18565","snapshot_observed_at":"2026-08-05T12:22:32.355438Z","title":"Pali-x: On scaling up a multilingual vision and language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:32.355438Z"},"links":{"cited_paper":"/paper/2305.18565","citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:e1517020a91920bf122f930278de8eb2377b6b7596a1559e29a4d376ae59fbae","observation_id":"313fd4f8-c736-42c0-8bfc-c223068f7d4e","resolution":{"observed_at":"2026-08-05T12:22:32.355438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-08-05T12:22:32.423076Z","title":"Pali: A jointly-scaled multilingual language-image model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:32.423076Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:6d18a37db6a41cf61f100c7f250505f0c819c3a9b404f6f57fb9eed3d6444f28","observation_id":"5a38f1a5-bc7e-40b7-adb5-408051470dd2","resolution":{"observed_at":"2026-08-05T12:22:32.423076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:37.945080Z","title":"Virtex: Learning visual representations from textual annotations","venue":null,"work_id":"cdd9ce74-f904-409d-9c29-eabbfb345817","year":2021},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:32.526318Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:59b37775a48146dd7ea89e144088633e582f594b40b8c6af09562ac82f0e742c","observation_id":"2af4d339-31f2-45cc-9cb4-a95d41a1886c","resolution":{"observed_at":"2026-08-05T12:22:37.953645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06710","last_updated":"2025-02-10T17:41:57Z","snapshot_observed_at":"2026-07-06T20:34:06.899427Z","submitted_at":"2025-02-10T17:41:57Z","title":"Learning Musical Representations for Music Performance Question Answering","version":1},"cited_work":{"arxiv_id":"2502.06710","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.06710","snapshot_observed_at":"2026-08-05T12:22:36.793760Z","title":"Learning Musical Representations for Music Performance Question Answering","venue":"cs.CV","work_id":"4b447967-4639-4e4f-a943-ae94d033b2e8","year":2025},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:32.582902Z"},"links":{"cited_paper":"/paper/2502.06710","citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:6df8ed6a9eb0d1b93fcff963052bc8ae6b26e63ae35dd753fdc07e17ba975eeb","observation_id":"487eeaa0-cee4-4056-9ee8-d9d6f8a06f5b","resolution":{"observed_at":"2026-08-05T12:22:36.803786Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06020","last_updated":"2025-02-09T20:26:30Z","snapshot_observed_at":"2026-07-06T20:33:39.014448Z","submitted_at":"2025-02-09T20:26:30Z","title":"Temporal Working Memory: Query-Guided Segment Refinement for Enhanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06020","snapshot_observed_at":"2026-08-05T12:22:32.652497Z","title":"Temporal working memory: Query-guided seg- ment refinement for enhanced multimodal understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:32.652497Z"},"links":{"cited_paper":"/paper/2502.06020","citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:c3df8d11f5c6b6bab3440f20b59c8ec0451d32ed40f15b87e9af5fe809c899e7","observation_id":"b107f77a-1c8a-42a2-9d10-8475833fc3d6","resolution":{"observed_at":"2026-08-05T12:22:32.652497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08541","last_updated":"2024-01-16T18:03:37Z","snapshot_observed_at":"2026-07-06T17:16:17.240820Z","submitted_at":"2024-01-16T18:03:37Z","title":"Scalable Pre-training of Large Autoregressive Image Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08541","snapshot_observed_at":"2026-08-05T12:22:32.780054Z","title":"Scalable pre- training of large autoregressive image models.arXiv preprint arXiv:2401.08541, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:32.780054Z"},"links":{"cited_paper":"/paper/2401.08541","citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:ca3e2c186480478ab537bf5525727b689145b517ff5bf110b3e120586145238a","observation_id":"505638ea-f1f5-4a45-97f1-1463a38f024b","resolution":{"observed_at":"2026-08-05T12:22:32.780054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:37.888648Z","title":"Improving clip training with language rewrites","venue":null,"work_id":"a15c1b5f-8004-4405-b435-3c8d97356f4b","year":2024},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:32.872014Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:c9dc3100a32744f9b3059463720be10734dc9e18cad8eb690233a07480a3aa77","observation_id":"63f53512-35cf-4345-918e-a3e7c47c7c9c","resolution":{"observed_at":"2026-08-05T12:22:37.917562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17425","last_updated":"2023-11-06T02:47:51Z","snapshot_observed_at":"2026-07-06T16:25:38.571377Z","submitted_at":"2023-09-29T17:37:29Z","title":"Data Filtering Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17425","snapshot_observed_at":"2026-08-05T12:22:33.199565Z","title":"Data fil- tering networks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:33.199565Z"},"links":{"cited_paper":"/paper/2309.17425","citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:9e0a23be3e910820955c7e168dd0fd696c38830749e36dd486cdca5a0a44facb","observation_id":"2644c2e3-a988-4830-a232-90903decb198","resolution":{"observed_at":"2026-08-05T12:22:33.199565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-07-06T19:53:56.407834Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-08-05T12:22:33.329919Z","title":"Mul- timodal autoregressive pre-training of large vision encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:33.329919Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:66f4c7d5a2fae30adf4487fa56d10e9c7df27d2d3b6f55e47599a54eea6eb641","observation_id":"0318e99b-ce9f-42c5-bb61-293b850ed45c","resolution":{"observed_at":"2026-08-05T12:22:33.329919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-05T12:22:33.521610Z","title":"Mme: A comprehensive evaluation bench- mark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:33.521610Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:bf9e634b67e8ecc7edf810a771cc4740fe638835086870f089f4c8c798003529","observation_id":"941b4be7-1e48-4b85-8b2e-757a4e93f2f2","resolution":{"observed_at":"2026-08-05T12:22:33.521610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14108","last_updated":"2023-10-20T17:01:44Z","snapshot_observed_at":"2026-07-06T15:20:41.322682Z","submitted_at":"2023-04-27T11:37:18Z","title":"DataComp: In search of the next generation of multimodal datasets","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14108","snapshot_observed_at":"2026-08-05T12:22:33.659440Z","title":"Dat- acomp: In search of the next generation of multimodal datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:33.659440Z"},"links":{"cited_paper":"/paper/2304.14108","citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:b514ff1f6c769a3608a69b54ad0bd5496c08e4a08b3c491fcb6b3b89a5f21fa5","observation_id":"98faa756-30e0-4b35-a4e4-807594854e0b","resolution":{"observed_at":"2026-08-05T12:22:33.659440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.00849","last_updated":"2020-06-22T09:09:22Z","snapshot_observed_at":"2026-08-04T21:04:33.037459Z","submitted_at":"2020-04-02T07:39:28Z","title":"Pixel-BERT: Aligning Image Pixels with Text by Deep Multi-Modal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.00849","snapshot_observed_at":"2026-08-05T12:22:33.772130Z","title":"Pixel-bert: Aligning image pixels with text by deep multi-modal transformers","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:33.772130Z"},"links":{"cited_paper":"/paper/2004.00849","citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:94cef06074abda6a7c258baef4834ce952e6e72eea39f8f09d3aa8bc39960666","observation_id":"47a14ad9-84c8-4574-90ca-4e2cff0b5ee6","resolution":{"observed_at":"2026-08-05T12:22:33.772130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:33.923744Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:33.923744Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:3faee4a16a666dff878990288d900ee3be51a7b6cb1c4ef358e9d62ef738799f","observation_id":"395ade9c-bbc6-4a3a-95c3-67e5ce3beaec","resolution":{"observed_at":"2026-08-05T12:22:33.923744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:37.830994Z","title":"Open- clip","venue":null,"work_id":"0911e67d-a56c-458c-b886-e95a0e0d6096","year":2021},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:34.066643Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:43d3645c0e96dc8c7460a6059c10e92d81410e9bac7b349d304b11aca39ac6a9","observation_id":"d9bd0af9-2c21-43c1-9fe0-b36231603e0d","resolution":{"observed_at":"2026-08-05T12:22:37.840545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:37.785483Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"bd753201-94d5-483f-87ea-2814158f52d0","year":2021},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:34.191768Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:99a600d8b195cfb736ef92fb4e25f8e3a2485356f835ae86008dbb70ad3ddce6","observation_id":"dd03223c-6af5-4d78-8340-399ab782ead3","resolution":{"observed_at":"2026-08-05T12:22:37.798252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:37.736352Z","title":"Learning visual features from large weakly supervised data","venue":null,"work_id":"200c0c3f-b6ae-4378-88c0-a018e3e7d172","year":2016},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:34.328207Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:87c726799d46895e9d52ae5c1bb22576488a1edb04a6381f1d35ff15eff14853","observation_id":"e0aff7eb-aadf-4f01-9269-4ea65727829c","resolution":{"observed_at":"2026-08-05T12:22:37.759099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:37.711784Z","title":"Deep visual-semantic align- ments for generating image descriptions","venue":null,"work_id":"6192b384-b557-4307-a0cc-075c909ddfa2","year":2015},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:34.421647Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:6d097771655a4ef2196fd5d9d5b18c2bd6896899f7b404240be6090722452d4a","observation_id":"931daa9a-01c9-4e79-b00e-68952f45e7d7","resolution":{"observed_at":"2026-08-05T12:22:37.720481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:37.675515Z","title":"Vilt: Vision- and-language transformer without convolution or region su- pervision","venue":null,"work_id":"08a5e4d6-8c1a-45bc-a25d-ff6cd2e0d330","year":2021},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:34.591130Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:fdb301dd10796aa27b5eafcfad40e7aec0ac9f0da0846d73209d6c2c4635d7e4","observation_id":"19d4ccc2-4a75-4acd-8614-b093f8c1c5e7","resolution":{"observed_at":"2026-08-05T12:22:37.689855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:37.648607Z","title":"Veclip: Improving clip training via visual-enriched captions","venue":null,"work_id":"baab454d-7249-4665-a8ed-e9e786a8ce15","year":2024},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:34.737816Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:6423fd4c281ce84f3fb489084b8c3e5f5d361d55d465366469a66c1f5abc6e33","observation_id":"12c60015-cc86-464e-9daf-49dda71f9333","resolution":{"observed_at":"2026-08-05T12:22:37.656536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:37.620118Z","title":"Learning visual n-grams from web data","venue":null,"work_id":"e3919ba9-3cf9-45cb-8312-2c4e4ab4d41e","year":2017},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:34.867133Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:e0faeb9270083c2beeb339940acc54e491512d74cbf593560a8cc756612db9d4","observation_id":"dc92feb3-0176-4b9b-bf84-89e1c99efe61","resolution":{"observed_at":"2026-08-05T12:22:37.629877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-05T12:22:34.980214Z","title":"Seed-bench: Benchmarking mul- timodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:34.980214Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:e5a3f8d6b50df56a942f1b296b39cb30df1ee127aaf3f24feec54b74b4f09894","observation_id":"14433b13-cfb1-4179-bd76-b63cca80af55","resolution":{"observed_at":"2026-08-05T12:22:34.980214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:35.099382Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.099382Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:f04db69f82708e7dbd4c305ffa92f78e3e4b2db71794b610de5278da88f0300d","observation_id":"32a9aefd-6dd5-494d-9197-e9b69b23443e","resolution":{"observed_at":"2026-08-05T12:22:35.099382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:35.212426Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.212426Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:162b5390a0f83ea0d8bf6e31754f1d20cf983846824a2d4dc64e915ce020d53f","observation_id":"be819195-7e08-4fa5-8a42-58e0aca29630","resolution":{"observed_at":"2026-08-05T12:22:35.212426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:37.541444Z","title":"Align before fuse: Vision and language representation learn- ing with momentum distillation","venue":null,"work_id":"bad9b6d7-5c6c-44ac-80f6-36c8e46a80f5","year":2021},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.350031Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:db5152f56a6e0169a79645bca79a442b1a1348741c858d4d67af86bbc3375815","observation_id":"c4b6daa7-0aa3-4079-bc33-fc9a67b7ded3","resolution":{"observed_at":"2026-08-05T12:22:37.550385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04601","last_updated":"2025-05-07T17:48:35Z","snapshot_observed_at":"2026-08-07T15:49:05.464106Z","submitted_at":"2025-05-07T17:48:35Z","title":"OpenVision: A Fully-Open, Cost-Effective Family of Advanced Vision Encoders for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04601","snapshot_observed_at":"2026-08-05T12:22:35.377071Z","title":"Openvision: A fully-open, cost-effective family of advanced vision encoders for multimodal learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.377071Z"},"links":{"cited_paper":"/paper/2505.04601","citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:d145bdd49244e91bb75774027f435e667c871b6bb4349ecc3894228372f91326","observation_id":"67f44edf-b97d-46a6-bf67-be7c43d53446","resolution":{"observed_at":"2026-08-05T12:22:35.377071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08478","last_updated":"2024-06-18T11:47:26Z","snapshot_observed_at":"2026-07-06T18:29:49.284504Z","submitted_at":"2024-06-12T17:59:07Z","title":"What If We Recaption Billions of Web Images with LLaMA-3?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08478","snapshot_observed_at":"2026-08-05T12:22:35.506534Z","title":"What if we recaption billions of web images with llama-3? arXiv preprint arXiv:2406.08478,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.506534Z"},"links":{"cited_paper":"/paper/2406.08478","citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:8baebb3d0836972070edc31f417983c7f99d45415691cfefe503269573356482","observation_id":"2124472e-1761-4fa3-88f0-08854232d528","resolution":{"observed_at":"2026-08-05T12:22:35.506534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:37.510491Z","title":"An inverse scal- ing law for clip training","venue":null,"work_id":"26d884fa-5712-4cec-bce7-fb86f5e82a22","year":2023},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.536881Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:9442adadfd12943b140c9d3a21ce8ddc68839162b4c6ec113fda61dda14ba0d6","observation_id":"159157b4-97f0-45f4-a65a-0f524f7c7493","resolution":{"observed_at":"2026-08-05T12:22:37.517305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:37.476642Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"c05de2d9-aaea-4a4b-a518-f4fe989985af","year":2023},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.565297Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:31f957b00482d24d3055b36937f4cb71df67ad58da9558558df83c662c0518e8","observation_id":"8ca4bc67-469d-426d-8095-ec448cac8178","resolution":{"observed_at":"2026-08-05T12:22:37.483786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:37.434588Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"168a2469-b1f6-40b0-8153-588f67a09513","year":2023},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.578726Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:e05343d61463622a836ec50c1b34c7fb61e0b384c6984c69be2166e40912102c","observation_id":"ccc04d01-7477-4b74-a313-2d1d61bf5473","resolution":{"observed_at":"2026-08-05T12:22:37.446501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:37.387165Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge","venue":null,"work_id":"e0340dfb-87a7-43a6-8d10-56df8c7ae8f2","year":2024},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.588360Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:80d9f9719f6333c8c84dd0f9fda50e3a8ae1c5454719f7c17a63b277d03cde20","observation_id":"be78f29c-2021-4df5-adb2-06593a868d3c","resolution":{"observed_at":"2026-08-05T12:22:37.397293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-05T12:22:35.596028Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.596028Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:622782771aca62864c9cce0e68a7c2453d8233e20cb8458e7c5aa6c79927bc6c","observation_id":"1eb0e4c0-8a68-481b-b4f0-9fd423270969","resolution":{"observed_at":"2026-08-05T12:22:35.596028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16828","last_updated":"2024-11-25T18:49:02Z","snapshot_observed_at":"2026-08-05T10:26:30.718972Z","submitted_at":"2024-11-25T18:49:02Z","title":"CLIPS: An Enhanced CLIP Framework for Learning with Synthetic Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16828","snapshot_observed_at":"2026-08-05T12:22:35.606923Z","title":"Clips: An enhanced clip framework for learning with synthetic captions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.606923Z"},"links":{"cited_paper":"/paper/2411.16828","citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:65dcf4a7101a98013881fdae8607460ab91bfbe4f81a4da8b851e3a72ea3dcd4","observation_id":"bd5172db-a689-4111-ae86-087c771bf7ab","resolution":{"observed_at":"2026-08-05T12:22:35.606923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:37.360229Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models","venue":null,"work_id":"11fcb3de-fe60-493d-9719-0f194a32ba19","year":2024},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.619550Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:578ca768cf12005dd58b830ff13052385bbbc7f52380257eefa938738c426979","observation_id":"e47fd057-702d-4d69-8b35-91d7acde64ef","resolution":{"observed_at":"2026-08-05T12:22:37.366993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18765","last_updated":"2024-03-13T08:47:32Z","snapshot_observed_at":"2026-07-06T16:55:09.267685Z","submitted_at":"2023-11-30T18:05:52Z","title":"MLLMs-Augmented Visual-Language Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18765","snapshot_observed_at":"2026-08-05T12:22:35.627900Z","title":"Mllms- augmented visual-language representation learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.627900Z"},"links":{"cited_paper":"/paper/2311.18765","citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:8688bc1da616eb9ec3907e0b9ee762c8d33585abdae6a917b10fd759ae8909d9","observation_id":"d66bc4c3-8c74-4396-8636-f1dcaca02fe3","resolution":{"observed_at":"2026-08-05T12:22:35.627900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:37.331982Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision language audio and action","venue":null,"work_id":"2f238bef-57cc-495b-8463-a56332b78b3d","year":2024},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.643604Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:bf0bf1c7d48e24db30e1c42b4dc42a799a77ac09ca7cc2880a66e27d7a575a4c","observation_id":"a4e4d833-649b-466e-a76b-920ad2148b11","resolution":{"observed_at":"2026-08-05T12:22:37.338939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:37.306255Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"05788722-f4c4-434a-a474-7f3d5fc334e2","year":2022},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.652763Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:a76785157c735fc1aeed94849060973941e1af077f3bfd98e92b13e6fe87d2d9","observation_id":"01b1815e-e04a-4ccc-92a6-5e6a9a142855","resolution":{"observed_at":"2026-08-05T12:22:37.311538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:37.278196Z","title":"ChartQA: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":"20cc119f-84f6-4017-a1b0-e8fd92db4713","year":2022},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.666074Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:86bb93c1ce4b8f744ae5bfbf3e37c1de9ce72c9d88edfc56ed16d288afb6c9a6","observation_id":"d4278d2c-71e8-4bb0-af6d-0ff39448a37f","resolution":{"observed_at":"2026-08-05T12:22:37.287786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-05T12:22:35.673312Z","title":"Kosmos-2: Ground- ing multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.673312Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:b0cccef30e6df7dd5c100c55d9934f62e7db6065a7ab5d3c494c818480698bb1","observation_id":"05f11dd9-6210-4a1f-afb4-27d7e2e95ff0","resolution":{"observed_at":"2026-08-05T12:22:35.673312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:35.679406Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.679406Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:bf714a8dd83b522770f02c7cf2466db2f29673469ce16f9050cfb50cbd3794d0","observation_id":"3c9f56c5-0976-4beb-8888-4e92d67123fa","resolution":{"observed_at":"2026-08-05T12:22:35.679406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:35.685613Z","title":"Improving language understanding by gen- erative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.685613Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:198a8e0ae941612f1b4705baa5c6f64bd1c18b6cb8e20a85a48314764d0cfd7c","observation_id":"5987f3ac-96e9-4bf3-b8c5-8a67bc3d6004","resolution":{"observed_at":"2026-08-05T12:22:35.685613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:37.175101Z","title":"Language models are unsu- pervised multitask learners","venue":null,"work_id":"6856ae33-f657-4e16-a83f-5ff59a71fb0f","year":2019},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.693138Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:fad85cce76d7c50b01bd1ce0ec92546f9ffacb87740c957d329d22146ef57550","observation_id":"e2a84847-cf8c-4886-b920-c439921bc361","resolution":{"observed_at":"2026-08-05T12:22:37.188232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:37.144664Z","title":"Learning visual representations with caption annotations","venue":null,"work_id":"cf121e3c-08dd-4a10-937a-f5d567e7ede9","year":2020},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.703968Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:9e94c0d6e52c2603532cee7cbffcc9a2c1ca43aac25063ff08a80f1dbfc42374","observation_id":"1861d3a1-de43-44ad-b365-45865d87b0b4","resolution":{"observed_at":"2026-08-05T12:22:37.150797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-05T12:22:35.710452Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.710452Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:9ee6b8298d480dc2d21f3366ed565cb50e5ed870380e025913a81c9c23d74b4b","observation_id":"f6ccd962-bd75-4097-a000-c4602d3e3c7b","resolution":{"observed_at":"2026-08-05T12:22:35.710452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:35.718812Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.718812Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:e3c845bd3d4612f520832ef731a806d00a189872494c14d97caefaf23c1beffb","observation_id":"b35f7dc4-eb34-448f-9acf-bc9f496caaf1","resolution":{"observed_at":"2026-08-05T12:22:35.718812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T12:22:35.731050Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.731050Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:d9edfedb8ae4675c0c792a2664bde073485ffc5a48c9ad1021f629441cd61e87","observation_id":"2d429898-6337-47ec-82bf-e4572a281f2c","resolution":{"observed_at":"2026-08-05T12:22:35.731050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-05T12:22:35.752713Z","title":"Emu: Generative pretraining in multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.752713Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:b3dedf5ea8ed573eb70cdf9901a0f311613b813f89ba86dd4ae061669020225c","observation_id":"b994c06d-2bf8-42f8-a806-75fb8d5c903c","resolution":{"observed_at":"2026-08-05T12:22:35.752713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-07T22:11:30.869700Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-05T12:22:35.760863Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.760863Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:2c2f5b1a2d8841462c704c90d5fd459018c74a39cf941bbadcd3ba6921432419","observation_id":"6f30213f-1104-46d1-b48d-583098ef147b","resolution":{"observed_at":"2026-08-05T12:22:35.760863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:37.104755Z","title":"Image captioners are scalable vision learners too","venue":null,"work_id":"f33e05b7-fa1f-4d96-94b6-81f6b5ecc531","year":2024},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.768792Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:7f087198670ba039dde1642902244d335bdd098a03222a1b6fde7cb7086f6c1d","observation_id":"9bba2b83-8108-49f8-8411-f070ad9b491f","resolution":{"observed_at":"2026-08-05T12:22:37.111167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:37.079204Z","title":"Show and tell: A neural image caption gen- erator","venue":null,"work_id":"8e60a85e-6174-47d7-ab5a-51cd9cd84d27","year":2015},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.777479Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:0ce6a0f70e20e7be12f2ec987555fcfd2942da661de5fe7e9f8726517c667999","observation_id":"e361bb20-d1f6-4f69-89b4-bea689bb6f11","resolution":{"observed_at":"2026-08-05T12:22:37.087691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-04T09:31:34.784365Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14100","snapshot_observed_at":"2026-08-05T12:22:35.785999Z","title":"Git: A generative image-to-text transformer for vision and language","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.785999Z"},"links":{"cited_paper":"/paper/2205.14100","citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:35b19ef5cb18875089e540485a5bf265f0a44828199cb7ade132d992657edf36","observation_id":"5cd19f60-9f85-4e89-884c-0cb945a16a3c","resolution":{"observed_at":"2026-08-05T12:22:35.785999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:37.041521Z","title":"Simvlm: Simple visual language model pretraining with weak supervision","venue":null,"work_id":"cbf7e562-aaa5-4990-b53f-342c1cd87c75","year":2022},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.796062Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:b1049e4eca1eb53155f1e7d76d823938b171a517bfc942ba252681e06bba3a44","observation_id":"3d0e87c1-b4d3-4fdc-85cd-1b468b421cd9","resolution":{"observed_at":"2026-08-05T12:22:37.053871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-05T12:22:35.803847Z","title":"Vila-u: a unified foundation model inte- grating visual understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.803847Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:1839d2874f46dda56ed7c86cfd9eca138dafb0ddf8caa493b7a655ee8264cbe0","observation_id":"53b3c1f6-142c-4f3f-af8c-5d3e7362bde7","resolution":{"observed_at":"2026-08-05T12:22:35.803847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-05T12:22:35.817127Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.817127Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:2b2142632c72a148b9c682315dbcf619b8f470235c6dff7ac79be6adec45c403","observation_id":"ebb02969-488b-488d-8a65-8b1db26bcfe2","resolution":{"observed_at":"2026-08-05T12:22:35.817127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:37.011098Z","title":"Demystifying clip data","venue":null,"work_id":"85f5c957-ae6d-417f-9aa9-c96a6f605d93","year":2023},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.829539Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:830c9611eba8de9cd1c10d20482f19f25cf74eb046a3ebb54bcfa2f7c840e67c","observation_id":"6618a9d2-9863-41de-a2ce-e5512b08acca","resolution":{"observed_at":"2026-08-05T12:22:37.019627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:36.982846Z","title":"Show, attend and tell: Neural image caption gen- eration with visual attention","venue":null,"work_id":"8f674e91-d238-48ef-8eec-5a063215c730","year":2048},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.836490Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:6741dc6ad455e313051a867c27b6426c4eab44a4eee3c96c9575138220d34cb0","observation_id":"0ea1aedb-6682-474a-a017-ff205f8672d1","resolution":{"observed_at":"2026-08-05T12:22:36.990932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-05T12:22:35.842656Z","title":"Coca: Contrastive captioners are image-text foundation models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.842656Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:320a0d6a21dc105b5285cd01f1fcb379725a8458644a5b79487b7f39a8abc59f","observation_id":"0f74dd6b-fb83-4269-9b00-d7cd63c16282","resolution":{"observed_at":"2026-08-05T12:22:35.842656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:36.949464Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"5416eb03-6df8-442a-a482-1ebe4ecb8ab7","year":2023},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.851286Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:566e07a6b2547cb202fc8b555469febdbb7e317be4dd17b12dd5263f6d015f6b","observation_id":"15110c82-2031-4011-877f-ca696559a30a","resolution":{"observed_at":"2026-08-05T12:22:36.957260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:22:36.916392Z","title":"Dreamlip: Language- image pre-training with long captions","venue":null,"work_id":"2f3eb277-0f59-4c48-aa26-44bd9da7d7f9","year":2024},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.866665Z"},"links":{"citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:9d5568a46a07836bcf9160632fb02e727c49a75deca289dd6de09c18cf788571","observation_id":"32d4ff18-a9f5-40b9-baf0-6c7177c5d672","resolution":{"observed_at":"2026-08-05T12:22:36.924665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":1,"verified_fuzzy":30},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 4 inbound Pith citation observations for arXiv:2509.01644."}