{"as_of":"2026-08-06T10:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d4abbd6215bbfda8b147c8652721f1aae29970062d576c484ade4abfa6849043","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:00:12.466258Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T07:07:43.056117Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"cited_work":{"arxiv_id":"2604.12012","doi":"10.48550/arxiv.2604.12012","metadata_source":"pith","pith_arxiv_id":"2604.12012","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","venue":"cs.CV","work_id":"5e9b3ddf-5b6b-4042-b640-d0d8757bfe14","year":2026},"citing_paper":{"arxiv_id":"2604.20329","last_updated":"2026-06-03T18:02:24Z","snapshot_observed_at":"2026-07-06T23:06:49.210284Z","submitted_at":"2026-04-22T08:23:48Z","title":"Image Generators are Generalist Vision Learners","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T01:14:05.034951Z"},"links":{"cited_paper":"/paper/2604.12012","citing_paper":"/paper/2604.20329"},"observation_digest":"sha256:685e5c8fbac7f72c31cd64ba979319bb2e41afb0d0f59ac3ff6025b095cfe627","observation_id":"85e2c683-0ee5-43af-a5e5-a03131446bf8","resolution":{"observed_at":"2026-05-11T13:41:06.045062Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"cited_work":{"arxiv_id":"2604.12012","doi":"10.48550/arxiv.2604.12012","metadata_source":"pith","pith_arxiv_id":"2604.12012","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","venue":"cs.CV","work_id":"5e9b3ddf-5b6b-4042-b640-d0d8757bfe14","year":2026},"citing_paper":{"arxiv_id":"2604.20329","last_updated":"2026-06-03T18:02:24Z","snapshot_observed_at":"2026-07-06T23:06:49.210284Z","submitted_at":"2026-04-22T08:23:48Z","title":"Image Generators are Generalist Vision Learners","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T07:40:46.090808Z"},"links":{"cited_paper":"/paper/2604.12012","citing_paper":"/paper/2604.20329"},"observation_digest":"sha256:9de64117400146c69c063f2e0e43237fceee169d434925132da3ba38a12f21ee","observation_id":"e64482e8-370d-4625-9114-fec3b11aa0d3","resolution":{"observed_at":"2026-05-15T07:45:14.646817Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"cited_work":{"arxiv_id":"2604.12012","doi":"10.48550/arxiv.2604.12012","metadata_source":"pith","pith_arxiv_id":"2604.12012","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","venue":"cs.CV","work_id":"5e9b3ddf-5b6b-4042-b640-d0d8757bfe14","year":2026},"citing_paper":{"arxiv_id":"2605.06809","last_updated":"2026-05-07T18:08:31Z","snapshot_observed_at":"2026-08-03T23:33:44.795399Z","submitted_at":"2026-05-07T18:08:31Z","title":"LookWhen? Fast Video Recognition by Learning When, Where, and What to Compute","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-11T01:36:50.406353Z"},"links":{"cited_paper":"/paper/2604.12012","citing_paper":"/paper/2605.06809"},"observation_digest":"sha256:c4685f9cf38b0d7dc3f692cf779c5868f4480bbdea0b1294ce1b5ce5fd832288","observation_id":"153ea559-a258-4bed-8a87-1ee1dc28e482","resolution":{"observed_at":"2026-05-11T01:40:52.145228Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"cited_work":{"arxiv_id":"2604.12012","doi":"10.48550/arxiv.2604.12012","metadata_source":"pith","pith_arxiv_id":"2604.12012","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","venue":"cs.CV","work_id":"5e9b3ddf-5b6b-4042-b640-d0d8757bfe14","year":2026},"citing_paper":{"arxiv_id":"2605.10616","last_updated":"2026-05-11T14:12:05Z","snapshot_observed_at":"2026-08-02T09:44:08.889357Z","submitted_at":"2026-05-11T14:12:05Z","title":"MulTaBench: Benchmarking Multimodal Tabular Learning with Text and Image","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T04:53:40.505699Z"},"links":{"cited_paper":"/paper/2604.12012","citing_paper":"/paper/2605.10616"},"observation_digest":"sha256:ccae8b89bbadbc121c40156818de3696db995dd3f921cfb479ecc5835680728d","observation_id":"5c6d84be-dede-4489-8e39-2c5ad9f0611c","resolution":{"observed_at":"2026-05-12T05:51:24.724170Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"cited_work":{"arxiv_id":"2604.12012","doi":"10.48550/arxiv.2604.12012","metadata_source":"pith","pith_arxiv_id":"2604.12012","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","venue":"cs.CV","work_id":"5e9b3ddf-5b6b-4042-b640-d0d8757bfe14","year":2026},"citing_paper":{"arxiv_id":"2605.16745","last_updated":"2026-05-16T01:55:03Z","snapshot_observed_at":"2026-07-29T20:43:08.563991Z","submitted_at":"2026-05-16T01:55:03Z","title":"EVA01: Unified Native 3D Understanding and Generation via Mixture-of-Transformers","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-19T21:26:36.707554Z"},"links":{"cited_paper":"/paper/2604.12012","citing_paper":"/paper/2605.16745"},"observation_digest":"sha256:ff1bdd7f0ff9f6e18e55c0d21b4924d9773b742a9b58d97c36665e46312a6acb","observation_id":"2eee143d-e8cc-47de-9714-d5fe4de6612c","resolution":{"observed_at":"2026-05-19T21:27:47.864848Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"cited_work":{"arxiv_id":"2604.12012","doi":"10.48550/arxiv.2604.12012","metadata_source":"pith","pith_arxiv_id":"2604.12012","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","venue":"cs.CV","work_id":"5e9b3ddf-5b6b-4042-b640-d0d8757bfe14","year":2026},"citing_paper":{"arxiv_id":"2606.19088","last_updated":"2026-06-17T13:58:06Z","snapshot_observed_at":"2026-08-03T06:49:13.095613Z","submitted_at":"2026-06-17T13:58:06Z","title":"ReSiReg: Towards Spatially Consistent Semantics in Language-Conditioned Robotic Tasks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T20:53:01.922037Z"},"links":{"cited_paper":"/paper/2604.12012","citing_paper":"/paper/2606.19088"},"observation_digest":"sha256:06a80e26cd06b1f4f32b13fa327f5d70f2da71eae291859b2f2ed73416e4640e","observation_id":"accff3d6-4c9b-4513-9ea7-7a1daea97668","resolution":{"observed_at":"2026-06-26T20:59:58.035717Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"cited_work":{"arxiv_id":"2604.12012","doi":"10.48550/arxiv.2604.12012","metadata_source":"pith","pith_arxiv_id":"2604.12012","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","venue":"cs.CV","work_id":"5e9b3ddf-5b6b-4042-b640-d0d8757bfe14","year":2026},"citing_paper":{"arxiv_id":"2606.21292","last_updated":"2026-06-19T10:16:29Z","snapshot_observed_at":"2026-08-01T00:24:38.943527Z","submitted_at":"2026-06-19T10:16:29Z","title":"Lightweight 3D Feature Pretraining by Bayesian Inversion of 2D Foundation Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T14:50:10.041000Z"},"links":{"cited_paper":"/paper/2604.12012","citing_paper":"/paper/2606.21292"},"observation_digest":"sha256:6512d4eb7283bd627e6fc0511aa1b6d88a983654b87e2e23536d2625f18bc8a7","observation_id":"a0ab3fbe-5941-493f-8f03-52b1b2ebbd3e","resolution":{"observed_at":"2026-07-04T06:09:37.353134Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.12012","snapshot_observed_at":"2026-08-01T07:07:43.056117Z","title":"TIPSv2: Advancing vision- language pretraining with enhanced patch-text alignment.arXiv preprint arXiv:2604.12012,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21576","last_updated":"2026-07-23T17:55:07Z","snapshot_observed_at":"2026-08-01T07:07:41.854955Z","submitted_at":"2026-07-23T17:55:07Z","title":"Self-Supervised Learning of Structured Dynamics from Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T07:07:43.056117Z"},"links":{"cited_paper":"/paper/2604.12012","citing_paper":"/paper/2607.21576"},"observation_digest":"sha256:13b0b1cebdfed2ec076f28f05e76e7937b40be22b6fb3bbc4b457bdfaf085ad9","observation_id":"de75f00c-62f0-4962-9043-dd50da99aee3","resolution":{"observed_at":"2026-08-01T07:07:43.056117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.12012/citation-record","integrity":"/paper/2604.12012/integrity","json":"/paper/2604.12012/citation-record.json","paper":"/paper/2604.12012"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alabdulmohsin, X","venue":null,"work_id":"59fa6afd-fca8-4a32-8883-539abdb08bd8","year":2023},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:fadbc2454c30220393939b647a1a5cd031aeb047dff493dd70945da5a0d0dcae","observation_id":"e82e152e-3443-434e-98f4-278ec7102e27","resolution":{"observed_at":"2026-05-17T17:30:01.343823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Assran, Q","venue":null,"work_id":"695c862b-b41d-40de-b3b6-3c72d3963a13","year":2023},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:f26ae723373791180c669288266ff0e74a6ea6f6bc3de84d8e09966a82c67c5b","observation_id":"79dd9586-3c98-4b69-865e-2fc480337926","resolution":{"observed_at":"2026-05-17T17:30:01.346511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-05T10:06:10.880743Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":"2407.07726","doi":"10.48550/arxiv.2407.07726","metadata_source":"pith","pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaliGemma: A versatile 3B VLM for transfer","venue":"cs.CV","work_id":"df6f48b3-5792-47c7-9614-cb856ea31ad9","year":2024},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:74f5052b7c384ceaa0a4303fd934511d956bc1428e35fc40245ab7bfddab1ee8","observation_id":"5b53f90c-5cd1-4b42-a2c3-dfa9d80eca4f","resolution":{"observed_at":"2026-05-11T13:10:21.987351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13181","last_updated":"2025-04-28T18:01:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T17:59:57Z","title":"Perception Encoder: The best visual embeddings are not at the output of the network","version":2},"cited_work":{"arxiv_id":"2504.13181","doi":"10.48550/arxiv.2504.13181","metadata_source":"pith","pith_arxiv_id":"2504.13181","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perception Encoder: The best visual embeddings are not at the output of the network","venue":"cs.CV","work_id":"409be941-4d4a-4ceb-a28a-eaa2d7709a1c","year":2025},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"cited_paper":"/paper/2504.13181","citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:6b4fb671a6c7835bdd5249ce683ab11621cb6586d5b56faae13d93746884a52b","observation_id":"41690dcd-4721-4494-ab71-858385071944","resolution":{"observed_at":"2026-05-13T22:21:16.084670Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Caron, H","venue":null,"work_id":"091a6f3f-0e84-4b90-9a11-f391a8ce9ea6","year":2021},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:c5b81419af93d555583721c6244bba09b1c6cd6405f36836e5c00885c99f2783","observation_id":"a141721a-5b17-4af4-81e0-49e1cc5a9faf","resolution":{"observed_at":"2026-05-17T17:30:01.336117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1dcf9b98-ce5d-4ff3-a617-6dddfce0f966","year":2023},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:9dc883d5b75cd9dc72923bf8c0af8f4f57fc70379a40ad463176e3ced8eabb55","observation_id":"9edf73e5-e280-4f36-819a-549fdee5dd8f","resolution":{"observed_at":"2026-05-17T17:30:01.279447Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2ccac421-3ab1-44e7-bfa1-ca66125250cb","year":2020},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:e7d612574724c2b0ecec7d60e0ae5327e861ad8d01e6ac8fb8852285e37b527c","observation_id":"6363c580-a099-41df-8417-195c842d9a58","resolution":{"observed_at":"2026-05-17T17:30:01.327880Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:bceeecb894901f20d4f8a5e6d2e09b3e08b41d78b0144f5cfd0e2a32698b1c2e","observation_id":"6eb3bc23-8ff8-4672-b700-2f559dca0f0d","resolution":{"observed_at":"2026-05-12T21:38:19.742717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ae9617ad-f36e-43af-957e-c1a1bcdd3fa5","year":2023},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:a888e4601424e308243687422784908901ff17170c9aa42a955ea69f7a727aeb","observation_id":"e23681a5-ecae-4fe2-89bc-2682dd498f5d","resolution":{"observed_at":"2026-05-17T17:30:01.414621Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cherti, R","venue":null,"work_id":"1259a43d-030f-4e67-b12e-5a94e5fd49ec","year":2023},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:7e020d7c9d3f7747e995d7270d2a2738e8e6d47b336be534d068c68d88395628","observation_id":"9ed60abe-4795-4411-9846-7189b3961bc7","resolution":{"observed_at":"2026-05-17T17:30:01.324882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chuang, Y","venue":null,"work_id":"8b30e28b-5856-4ecd-92f3-f1629e44bccc","year":2025},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:80224894b43d065f7b358920c2f22001684b0c7e84675d0f83231544f1948ea4","observation_id":"da1d535e-a3a3-44f9-9f56-a5e90fdbcc0b","resolution":{"observed_at":"2026-05-17T17:30:01.282075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Darcet, M","venue":null,"work_id":"dce5f02f-d239-40c8-948f-9c2f943c01ce","year":2024},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:a257bae987f22db2fe4b985705594c77e0115db516444750905874c469e6f326","observation_id":"b0dbe556-f6f8-459a-8de3-5ef898166eba","resolution":{"observed_at":"2026-05-17T17:30:01.322086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dosovitskiy, L","venue":null,"work_id":"fb2bc4c8-9e7f-4370-8fea-89da983b0ab9","year":2021},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:c74f547be244bd0abc21ce6fd8543c46a79182eca85fe809baa4327f1f1e039d","observation_id":"10c52f89-4891-4304-a475-4c1326fdb408","resolution":{"observed_at":"2026-05-17T17:30:01.379921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Everingham and J","venue":null,"work_id":"8b3bc16b-81f9-4910-a2ff-542c1d829063","year":2012},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:bae9cb20addd8877c817063f13859488991d25cd7b24ee4bc4a0e05585678252","observation_id":"964d3db5-51e4-477f-af25-0b8f71f6f82b","resolution":{"observed_at":"2026-05-17T17:30:01.385270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Everingham, L","venue":null,"work_id":"aea1a7ce-ff49-4793-bc0c-bea334859599","year":2010},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:25266061b9f8b130f842d8de5e1ee9680675ccf1a287d223ae645648f73effdb","observation_id":"e296c886-c839-42b0-b1aa-0708702ba190","resolution":{"observed_at":"2026-05-17T17:30:01.319566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01017","last_updated":"2025-04-01T17:59:15Z","snapshot_observed_at":"2026-08-03T20:04:29.599244Z","submitted_at":"2025-04-01T17:59:15Z","title":"Scaling Language-Free Visual Representation Learning","version":1},"cited_work":{"arxiv_id":"2504.01017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.01017","snapshot_observed_at":"2026-07-04T19:50:09.839784Z","title":"Scaling language-free visual representation learning.arXiv preprint arXiv:2504.01017","venue":null,"work_id":"99aa7a09-2b4a-446c-b623-3f34329c0d46","year":2025},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"cited_paper":"/paper/2504.01017","citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:82bbabaa9eaacd5127a5c9051f6b7cd8043c9ad43a73494f0b9b5ded40c4cb5a","observation_id":"96813c63-c740-421e-a79a-aafe56e4e5a7","resolution":{"observed_at":"2026-05-11T09:31:01.874816Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4097ed62-c20f-4264-a222-6d03c5ebe47e","year":2023},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:28fc1801096b010505e71643ec8580bbd8e806ef0844c5934d720bd1050fd8e8","observation_id":"a9f71bcb-4a7a-43df-bbb0-3f8d6410bf79","resolution":{"observed_at":"2026-05-17T17:30:01.382458Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"eb83a449-ebbc-43b3-8072-be450be709bc","year":2023},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:9312f667fa2bfab07db4f3178f2e324ff3cdbf144e2d35c28b20842d730fbf05","observation_id":"5e93eaae-4378-447d-8796-5bede516bd49","resolution":{"observed_at":"2026-05-17T17:30:01.330718Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5cb6e6d8-5bff-4f85-a0a2-a429f07a8a0f","year":2024},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:cac71adaf151955d32d1030cbd82ade529d5b43f8caddabd31622793aa5ccb53","observation_id":"6cbbf9bf-1f72-42d4-9342-9fcd29f7bcf0","resolution":{"observed_at":"2026-05-17T17:30:01.371586Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"39de5e8d-a99c-40c0-a74e-472dfd1bb87e","year":2025},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:f19b6d3160083b20f0b1936679cfe1c189e76d86e59178a4867528f5e7597f77","observation_id":"b7e1a9bf-9e27-4933-b3c3-8ffda34e3b0e","resolution":{"observed_at":"2026-05-17T17:30:01.357604Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b0bf1440-5f93-4c88-8687-e15233b889e5","year":2023},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:4fc6c2868d96e3b3a6aec2c02a076cce408f2f222ae2d378fd877d5b4c26bcc7","observation_id":"9bf9c295-3100-4b22-bcc8-2daf794b338f","resolution":{"observed_at":"2026-05-17T17:30:01.352329Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:a4a1c8121199bb1c252ca76b434b111ff3e27e5fe87444a81e81f63f64cb91c9","observation_id":"6323718e-be41-407e-ad5d-400726e3fabe","resolution":{"observed_at":"2026-05-11T09:31:01.908565Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grill, F","venue":null,"work_id":"dbf83caf-9674-4f03-b555-eea0041801c1","year":2020},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:6ea55026e680d5b0e463678c006087eabdba65f35de2efb45413316bd947dc10","observation_id":"fe65e40c-4e41-4536-ad36-03f146071b76","resolution":{"observed_at":"2026-05-17T17:30:01.290050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fc358f99-1e90-4107-8ded-26b2c6be91f5","year":2020},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:1821b2f21e5981863c838db23167bd96eae022b36cd2de02a331d871a6037085","observation_id":"6d67c1ce-cd5a-4268-b0c7-4bb69fe1980b","resolution":{"observed_at":"2026-05-17T17:30:01.284706Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"34b7ce60-2e3a-40c0-a41d-8d74a447c54e","year":2022},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:dd0c7e9a63a30f14b373d3bc922ded2a2828eb3429034d82fda7f384c9affe16","observation_id":"dcb37d35-930b-4dbe-98de-c2e280496883","resolution":{"observed_at":"2026-05-17T17:30:01.292817Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hinton, O","venue":null,"work_id":"e1bf0cb0-bf1b-4f42-8553-6102e3bc52e3","year":2015},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:59eb24f188674dbc2e401788a511b17981bea139c2d90cf931b6e5dcd40f4e87","observation_id":"e5052216-6309-4739-8ab5-0b44d655ce8e","resolution":{"observed_at":"2026-05-17T17:30:01.341144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jampani, K.-K","venue":null,"work_id":"003a635e-65a4-416d-9413-ef85d2f5ec09","year":2023},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:1a0b5d0f2753679b9aa8c0fe46e24cb2214279eebde6db6d3f4a369564391ebf","observation_id":"cc55c400-198a-4610-913e-3e73de8832e3","resolution":{"observed_at":"2026-05-17T17:30:01.368888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7e299007-d927-4799-91fa-54e0a8e7de32","year":2021},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:a14bbbe3d3f7ee8d139f5fe549e12681b4b3b3fc04900215997f8edf75565dd6","observation_id":"645d39e2-0104-425a-ae4c-42b2ab3cf69c","resolution":{"observed_at":"2026-05-17T17:30:01.374550Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c4b79fb2-b949-4927-bcf7-b75bdaef8fbd","year":2025},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:148aeefedb5d1cb51f9f020b32dc4013f09f631defe0d175304ff59362ae979c","observation_id":"1e6d563c-6c83-4ac3-9973-60dd020fbd92","resolution":{"observed_at":"2026-05-17T17:30:01.287422Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Krause, M","venue":null,"work_id":"974556b1-b6b4-4f2e-8f3c-7ca26428cddc","year":2013},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:58c05684f463acacdadfd9e2403608d796ad572a6b800d69282c14d6aa587dd0","observation_id":"e9953794-1853-4b28-9d8b-9fae203e4fa4","resolution":{"observed_at":"2026-05-17T17:30:01.411642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"760e6a8d-5d40-4e4d-8b58-60bcf6aee74d","year":2024},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:3dbf4f4a135bb8278af3342227a2e9f074035c8f4196cae3e56ccfd57d107c4d","observation_id":"9fd68227-7d58-46de-9276-d1a99aa48cc4","resolution":{"observed_at":"2026-05-17T17:30:01.417616Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"208801bc-96e7-4d69-91d7-002d6e70de0f","year":2016},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:c216dfa23f2ac2667677cca5020700c9e377816b12282f286b07e2a55043be45","observation_id":"3fc269b1-fff3-4476-a022-c966b0259b8a","resolution":{"observed_at":"2026-05-17T17:30:01.423422Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Maninis, K","venue":null,"work_id":"dcca230a-67b0-4937-b8ef-2785862efce8","year":2025},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:12a2318cf07c27d0b044351c5d6705c8d4bcaba2fc4267e3ef857c1263edf4a3","observation_id":"d6573569-bf40-46d0-acad-f0207e381a36","resolution":{"observed_at":"2026-05-17T17:30:01.408426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e83067ae-fff8-4f0d-951f-5151cdf1be50","year":2023},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:d03bf344cea1a9fb821404b77f6623e4a1a555bd364b02b638d621624b3a4944","observation_id":"5cef3dcb-c7c6-40ac-9838-75e0f2aa6fcc","resolution":{"observed_at":"2026-05-17T17:30:01.396889Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mottaghi, X","venue":null,"work_id":"8956c7a4-783f-41c5-a0da-11d787a331e7","year":2014},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:e89efc1a33f650a49c9d14bc3df924eda7ca00bc842af892ccceb93ea3b0269c","observation_id":"ddd2ec76-0513-49c2-9eb0-3c5c708968f3","resolution":{"observed_at":"2026-05-17T17:30:01.429902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"478560de-9115-4641-871d-8bdaedeea6dc","year":2024},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:9004c8b5e728cc2cf988dda9bdc8397236d6dfdb9f01a777bf6fe909cce9155c","observation_id":"e27d8f1f-28d1-416c-b9fb-e79222611833","resolution":{"observed_at":"2026-05-17T17:30:01.359978Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"657d3920-78eb-4106-85d3-0c03d4d7ee20","year":2024},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:7150e1065fea86e29bac500d4b68ccdbf50715529fdb68fdab4b929d5652c1e3","observation_id":"4cff6c34-b52d-4a45-ad53-108bfc8b5afe","resolution":{"observed_at":"2026-05-17T17:30:01.391019Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Oquab, T","venue":null,"work_id":"93d54f41-e805-4f3b-887e-f1ef4313ee9e","year":2024},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:66d4a4579b625e6494de1e6ab9a919a55eef1a66ddb9e192f81d251d4bb6ca8d","observation_id":"70dde919-7acf-49a7-8fb7-cee055fd6e98","resolution":{"observed_at":"2026-05-17T17:30:01.316944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.12634","last_updated":"2021-09-01T16:21:13Z","snapshot_observed_at":"2026-07-06T09:31:42.788370Z","submitted_at":"2020-06-22T21:39:56Z","title":"RP2K: A Large-Scale Retail Product Dataset for Fine-Grained Image Classification","version":7},"cited_work":{"arxiv_id":"2006.12634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.12634","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2006.12634 (2020)","venue":null,"work_id":"0a63ba38-608a-4298-8d29-65d7d58a92b5","year":2006},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"cited_paper":"/paper/2006.12634","citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:b34f474e0024263b5a83240e0c8ded639b29012966191ade699b13f6c603c281","observation_id":"0ada5ce0-2a64-4a83-ba59-206b92fde74e","resolution":{"observed_at":"2026-05-11T09:31:01.842217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Radford, J","venue":null,"work_id":"8b2d1f63-7450-4ebd-85e6-d6cc088b8445","year":null},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:362866efa0e652639d19a667df13a8f5cf875a4f87b57a1ae82dfe35bc891e7d","observation_id":"0a57ae36-25eb-4b29-81fa-aff34995568f","resolution":{"observed_at":"2026-05-17T17:30:01.295456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ranftl, A","venue":null,"work_id":"5c66597c-caaa-4b99-bf94-22ec69c3840a","year":2021},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:60d5ef86988f97205646392984af44516e38f4c9b7c2463bb54cecab90f0077c","observation_id":"b05c0a01-6b6f-4b30-a28e-08f622711759","resolution":{"observed_at":"2026-05-17T17:30:01.276712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Russakovsky, J","venue":null,"work_id":"f6aef4b9-8ab6-4dbd-b140-3d780add904f","year":2015},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:c08c0c392607b1be33ca272c62d599c257f7d542492136d67e2dce7766f47c9f","observation_id":"038d09b1-1cde-4dab-be26-8b335aa78ec3","resolution":{"observed_at":"2026-05-17T17:30:01.402500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shazeer and M","venue":null,"work_id":"170dde76-37e7-4ad1-9c32-203d48be7fce","year":2018},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:b1998233add5495987a182a99018e4e549af462a7cafece98abf77a11bd985d5","observation_id":"d99a704b-8c36-409d-b595-250a9bbd119f","resolution":{"observed_at":"2026-05-17T17:30:01.311216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Silberman, D","venue":null,"work_id":"84ed2745-7a6a-4ff9-a177-0032cd74ba1c","year":2012},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:619a5367fc1b0089e4b6ca4b20a244dc99029b327d239e917bcff6b28da53f31","observation_id":"eae4c2e3-b60c-482f-b7b2-ae78991f1a04","resolution":{"observed_at":"2026-05-17T17:30:01.305592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-07-06T22:12:35.584339Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":"2508.10104","doi":"10.1055/a-2487-1252","metadata_source":"pith","pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv3","venue":"cs.CV","work_id":"c8b07deb-8fe7-4e18-9620-f3569d3529ce","year":2025},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:d54892c8a0d41ec63478a1f9744a1dadc6edb66e9bf60b1eaec20e7b34a1c7cd","observation_id":"f06c4df7-ca5d-4caa-b92b-7476671ae4af","resolution":{"observed_at":"2026-05-11T09:31:01.854255Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b48048ec-06ce-42b0-813f-ee90eeec71e6","year":2016},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:2c2837dcbea1f9205970ad69407a7228a07161fc2a5ba8123607c5139599d195","observation_id":"648a415e-8c3a-4c43-9d4e-3298c9635949","resolution":{"observed_at":"2026-05-17T17:30:01.338749Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stone, H","venue":null,"work_id":"61bdbbf0-a30b-4f7d-9b95-0a60ffdf7cdb","year":2025},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:b8037a16f060b276e9f2e4f9d374da832304d839a376414e494997e51b6a77a3","observation_id":"b5e025aa-e39d-4f11-8b3f-05b21f4cdd43","resolution":{"observed_at":"2026-05-17T17:30:01.405278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:f0be34324842db67ab7affc2d1cdb014cebd5559b45f14b423a69d607f7893e6","observation_id":"f2ca36ba-bf71-4b66-99b2-967c260953f0","resolution":{"observed_at":"2026-05-13T01:54:22.133331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tschannen, M","venue":null,"work_id":"9a987d1b-e9d4-4881-8ab4-c39815f7b88e","year":2023},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:1d1cd682be853d1cdb8a2fdc9a3f7ebdc1364ba5557b8201bdff75681649796b","observation_id":"de1ef774-5ba3-49ae-9a21-61a55ee5f3b4","resolution":{"observed_at":"2026-05-17T17:30:01.399794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:0ae48999aa7b6513b1673e280628119cdce30a07af6ea31db9a18b7265f67a0b","observation_id":"167a5b7f-e425-426b-b5ac-94a09fae16f5","resolution":{"observed_at":"2026-05-11T09:31:01.933355Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":"1807.03748","doi":"10.1609/aaai.v36i10.21390","metadata_source":"pith","pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Learning with Contrastive Predictive Coding","venue":"cs.LG","work_id":"7b08a1d4-d565-424e-9c86-6ef244b7b90a","year":2018},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:25ebb35b2cc5f51d6aae45fec66d64d2efb40b155f92dface2790c7ffa21b9e7","observation_id":"0985afab-5336-467d-b415-8f33bb1a71cf","resolution":{"observed_at":"2026-05-11T09:31:01.946402Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Van Horn, O","venue":null,"work_id":"932e0aa4-87ca-44c8-8d42-8e166ce51870","year":2018},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:b1e1cf7f82fecdead484afd055272e098a76c19819281b89fd41e85b3219e38c","observation_id":"572e44a2-5d81-4632-8f90-1d8d796b1186","resolution":{"observed_at":"2026-05-17T17:30:01.388035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vaswani, N","venue":null,"work_id":"c4ceb161-d6a1-4be3-8c5e-74cb2c133208","year":2017},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:672702339bd04c66ce200d68d5ccdf8eae550f82cababcf5ffd3a0eb1a601580","observation_id":"a2def039-d0fc-4929-94a3-b6ce16831e01","resolution":{"observed_at":"2026-05-17T17:30:01.420456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14137","last_updated":"2026-04-25T14:06:10Z","snapshot_observed_at":"2026-07-06T21:59:25.077202Z","submitted_at":"2025-07-18T17:59:55Z","title":"Franca: Nested Matryoshka Clustering for Scalable Visual Representation Learning","version":4},"cited_work":{"arxiv_id":"2507.14137","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.14137","snapshot_observed_at":"2026-07-04T09:09:42.672223Z","title":"Franca: Nested Matryoshka Clustering for Scalable Visual Representation Learning","venue":"cs.CV","work_id":"97ebbd17-860e-4175-ac07-64a8f6f4e5d2","year":2025},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"cited_paper":"/paper/2507.14137","citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:9bf077cef3111a424679915a9bb837d38320ce2ac47212fe4d9b3b47103c7676","observation_id":"640b57de-2b43-4f8f-9f77-d0d276849686","resolution":{"observed_at":"2026-05-11T09:31:01.917283Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"15f68bf8-6a30-4b39-a4cc-b454027cd561","year":2024},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:6a95290c04d7e70f48db212193385ae74437e8f97dfbe776678f19c063467ad3","observation_id":"e07374f3-584b-4554-84a8-f22b4d12a38a","resolution":{"observed_at":"2026-05-17T17:30:01.393814Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Weyand, A","venue":null,"work_id":"6c6e3e6f-30bb-4ac0-b54b-099c32c9ba6d","year":2020},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:720872daed0baf45f07b1dd66787e2bd65634ad4d003e3360264faf6ceb6f10d","observation_id":"d8481022-3bb4-4673-9103-e216b13344eb","resolution":{"observed_at":"2026-05-17T17:30:01.365284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b9c5077c-7850-45e8-9b4a-5243f8c3c1be","year":2023},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:879ca857320572b181a9768d4a9c5c8d45cdf3190c404b43fe4ca829c4868030","observation_id":"cfca63ea-637d-4322-aec9-827bb74e7d28","resolution":{"observed_at":"2026-05-17T17:30:01.298022Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a0ebd641-9a8f-485d-b344-453752f9872d","year":2022},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:155872ebda8f5cac35813bb47df584327e338143371ec6011f6be2320e606548","observation_id":"b187b90f-7b56-4b58-914a-2e6fa0b40cbd","resolution":{"observed_at":"2026-05-17T17:30:01.300560Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"28a615a1-9f0d-4d4e-8e86-7e8e008588f5","year":2025},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:bbd806e06b23a74550cce0570759adcf1a9747fb7e0b67a8e955fbe756776037","observation_id":"de571cbc-35f6-4680-b8dc-5e4edcc7248e","resolution":{"observed_at":"2026-05-17T17:30:01.314077Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0a4d4257-4c1c-4917-bf6a-8662467d3f53","year":2023},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:c737422c0ab3dd599a7a03043f487015b1177740113bcf70283c3bd2a44f1e23","observation_id":"ccc206b0-b278-4455-9a43-12e4fa3ea331","resolution":{"observed_at":"2026-05-17T17:30:01.308306Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Young, A","venue":null,"work_id":"e35db41b-5a4d-43c1-9700-7af01724dc38","year":null},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:cc10d724f5936f1ebf79b0f1ba660e83ce67658a9b82dac9f47bae35f1e54d90","observation_id":"252acf1c-3cf9-46eb-afa5-7b29109e5ff2","resolution":{"observed_at":"2026-05-17T17:30:01.354805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ypsilantis, N","venue":null,"work_id":"76cc38fc-2b89-4733-a278-0aa265643cee","year":2021},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:18dc9ee603f653c245a6a5f643a69ce859845b75df87a27d1cf5bfb3f1cd1217","observation_id":"95392362-76fb-4f61-a4b7-abf8d142ee33","resolution":{"observed_at":"2026-05-17T17:30:01.349636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ypsilantis, K","venue":null,"work_id":"fc838cc0-7ff8-4db4-a107-0b302b67e8c4","year":2023},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:d2de2909b5a653e4c68f2798f485e13e3fecd8cfefdfc9d30c006fcd1fe9ce4b","observation_id":"772431e3-6a08-4288-a73a-19be9b542269","resolution":{"observed_at":"2026-05-17T17:30:01.377332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e307dbff-867b-4a06-a796-48d96f5ffd50","year":null},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:2c8f223bae51dac6a6a086c1c5a6addbd546f92edc52cc45c05d9640582335dc","observation_id":"7339b91e-48e2-4dcd-aa37-80e4bc7015f8","resolution":{"observed_at":"2026-05-17T17:30:01.426627Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b59431cb-9012-4089-9e6e-3726d717fc46","year":2017},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:e35fd059d8a67fd278b7d14d83eb9b3f19e376aa68d876f4fe81a11f30275d4b","observation_id":"7af2400c-2dbe-4fdf-a6fe-1fb210ea3e4d","resolution":{"observed_at":"2026-05-17T17:30:01.273974Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a5af66a2-b3df-4d5d-84ff-964cee7ad782","year":2019},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:52022804939401e530790216addfe24fd72d14507ab2110dd2640e40aa697309","observation_id":"6bc6cfb5-29ff-4d80-a008-3aea236cfd1c","resolution":{"observed_at":"2026-05-17T17:30:01.333418Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"807cd9a7-21f4-4cff-9fca-cac514c1c5d0","year":2022},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:2c69b69d251c16338b0956b7834b5a4052480ffe28997976ded92ceb7b69d47b","observation_id":"fd5b29c7-623c-4dd9-a777-ba7b49569ef6","resolution":{"observed_at":"2026-05-17T17:30:01.362658Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ad5ed353-9ce9-488d-b0a5-6030f858f8a7","year":2022},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:1bd7c62b39895a07efed6fddf0e178e2a547be0c52308b21685b304c4e8e8938","observation_id":"0642d745-9913-44dd-bde1-1c436fcedadb","resolution":{"observed_at":"2026-05-17T17:30:01.303042Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":11,"verified_fuzzy":29},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 8 inbound Pith citation observations for arXiv:2604.12012."}