{"as_of":"2026-08-17T15:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:38b91b3b84d3273e7494172a69a2c4c9ae23f5e22a060061283579e3b950a3b0","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:51:42.939404Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.20156/citation-record","integrity":"/paper/2507.20156/integrity","json":"/paper/2507.20156/citation-record.json","paper":"/paper/2507.20156"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-15T17:51:42.792055Z","title":", Gemini 1.5: Unlocking multi- modal understanding across millions of tokens of con- text, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.792055Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:60851af615729c6b86f0f69f7e0527c39cf9246f286cbdf3ef32d5cacac9399f","observation_id":"0e6b01c7-ae0a-4c47-aef8-eb42e524c7a7","resolution":{"observed_at":"2026-08-15T17:51:42.792055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.773755Z","title":"Wang et al., Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution ,","venue":null,"work_id":"64d52bf7-054d-4439-874e-5c2a6260fb20","year":null},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.797227Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:a788d9087eaebc8dc9895288b33aaadd49abc29bce35e8a759c2d050ac65065b","observation_id":"e00b4115-514b-4eee-95e4-1bb26842c2bc","resolution":{"observed_at":"2026-08-15T17:51:43.777817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T17:51:42.805659Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.805659Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:f5d4aee15549146a2cf720ed88fc8db434ab20c71fd75c8b3eed1462f5ba9cf7","observation_id":"183d1dc8-1e3a-4d5c-be39-1e6d9576aa0c","resolution":{"observed_at":"2026-08-15T17:51:42.805659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T17:51:42.809672Z","title":"Bai et al., Qwen2.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.809672Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:7b15a4a0d58b6e09beae545054f92a560e98d1aaa9ce69115642e2cc7ca6fc23","observation_id":"c2c8b985-9a1b-4bb4-b3dc-5917fd79b9e6","resolution":{"observed_at":"2026-08-15T17:51:42.809672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.761894Z","title":"LLaV A-onevision: Easy visual task transfer,","venue":null,"work_id":"c326a231-5c99-404e-bf3a-3bdf8cf7553a","year":2025},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.814331Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:74b7649c373eb3e34ab2b7a8c433223edd512916533e248222efc960c43f6476","observation_id":"b1318520-c311-4073-a0d8-7985c669838e","resolution":{"observed_at":"2026-08-15T17:51:43.765837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-15T17:51:42.818265Z","title":"Lu et al., Deepseek-vl: Towards real-world vision- language understanding , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.818265Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:e3c3e007966b60fa62d22c51de5879e4ba86da5d4682f0d83e0ccf2e77b8f6ea","observation_id":"73b8b5eb-d6ea-4da7-9035-8b5ca9246bfb","resolution":{"observed_at":"2026-08-15T17:51:42.818265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.749738Z","title":"Masry et al","venue":null,"work_id":"1bc9119a-c880-4190-8e8d-538cd71e6554","year":null},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.822523Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:d7050b90157c1d000d7d244e13b39dfcc94915f2b7957d24a3df04aab54731cd","observation_id":"336b6437-7ad8-4a96-aab0-9fafdb0b7ece","resolution":{"observed_at":"2026-08-15T17:51:43.753778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14276","snapshot_observed_at":"2026-08-15T17:51:42.830659Z","title":"Liang et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.830659Z"},"links":{"cited_paper":"/paper/2501.14276","citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:c4cc7017ab62fed50f9fcfa9e10e3f4a66b5d4da79018101d27f45d2e7c056df","observation_id":"1d86c0e1-6bd8-4667-8769-8edaf95e3ad4","resolution":{"observed_at":"2026-08-15T17:51:42.830659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.01239","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.536878Z","title":"Mplug-owi2: Revolutionizing multi- modal large language model with modality collab- oration,","venue":null,"work_id":"e3f3dffb-fe05-480d-9556-d73feead387e","year":2024},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.835619Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:56efed9435c8b8d12c29b055b6b28fcbad04c92900ac75fc3ab0b025c0835978","observation_id":"6b92f115-f401-4d14-ad10-ef1761793569","resolution":{"observed_at":"2026-08-15T17:51:43.543200Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2021.00356","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.471096Z","title":"Conceptual 12m: Pushing web- scale image-text pre-training to recognize long-tail visual concepts,","venue":null,"work_id":"faf706b7-d417-4f98-bc92-e28159edb537","year":2021},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.839683Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:2cad9fbe8bd43060e4a8ebc397f2669743e924604277664ee1e7257619ff6f50","observation_id":"78af3003-449a-47cc-91f8-2db9ee342ba2","resolution":{"observed_at":"2026-08-15T17:51:43.480475Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08478","last_updated":"2024-06-18T11:47:26Z","snapshot_observed_at":"2026-08-16T13:43:37.667967Z","submitted_at":"2024-06-12T17:59:07Z","title":"What If We Recaption Billions of Web Images with LLaMA-3?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08478","snapshot_observed_at":"2026-08-15T17:51:42.843903Z","title":"Li et al., What if we recaption billions of web im- ages with llama-3? 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.843903Z"},"links":{"cited_paper":"/paper/2406.08478","citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:c2f2384d4a0774d9ff3531c8a99507df37a9f6debb0696e22401cb0db66bf9f0","observation_id":"473a62d3-b1fd-4d9b-b6e9-383c663df6d5","resolution":{"observed_at":"2026-08-15T17:51:42.843903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.737681Z","title":"Obelics: An open web-scale fil- tered dataset of interleaved image-text documents,","venue":null,"work_id":"72017c30-2d05-4ffb-ad1a-d9ef4d61c7df","year":2023},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.848435Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:01ec1071ec8af006f29e6d07649c09bdb976fe81b3b9be60b3113f80513631c2","observation_id":"34c429a6-d137-4f20-96d0-0f6be4310713","resolution":{"observed_at":"2026-08-15T17:51:43.741786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.725861Z","title":"Bai et al","venue":null,"work_id":"f5767461-5b1c-403c-a475-5b10eef6c0cc","year":null},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.852105Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:54c382b6452912d0efad01bdad2591768d8e4c342929707dd630d037205723b4","observation_id":"9e104414-5404-4c31-9018-ac5f49acf053","resolution":{"observed_at":"2026-08-15T17:51:43.729804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-emnlp.889","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.154087Z","title":"Towards efficient visual-language align- ment of the q-former for visual reasoning tasks,","venue":null,"work_id":"02abf214-ed83-4c8a-9206-55dd1108087e","year":2024},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.861283Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:bf6b7f32e669c79e9bdd3e81cd38999651d7dd2bb02f0ed1544276b9263c4bda","observation_id":"0e493f98-bf3c-4af0-b44d-12a222dfb98d","resolution":{"observed_at":"2026-08-15T17:51:43.158871Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.713594Z","title":"Training language models to fol- low instructions with human feedback,","venue":null,"work_id":"fc54aa72-1927-4aaf-bcf6-ffe3c57326e7","year":2022},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.865159Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:334803bba04422d1ba5c9a259734bb4a4ed59d5450f697e38f1bc3ed4d62de6e","observation_id":"6e260517-0b60-4f18-a560-8cb159f743b1","resolution":{"observed_at":"2026-08-15T17:51:43.717929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04575","last_updated":"2024-03-05T21:02:33Z","snapshot_observed_at":"2026-08-16T14:28:48.915220Z","submitted_at":"2024-01-09T14:24:29Z","title":"Let's Go Shopping (LGS) -- Web-Scale Image-Text Dataset for Visual Concept Understanding","version":2},"cited_work":{"arxiv_id":"2401.04575","doi":"10.48550/arxiv.2401.04575","metadata_source":"pith","pith_arxiv_id":"2401.04575","snapshot_observed_at":"2026-08-15T18:16:14.067578Z","title":"Let's Go Shopping (LGS) -- Web-Scale Image-Text Dataset for Visual Concept Understanding","venue":"cs.CV","work_id":"d454ec9e-1dc5-4fe0-be56-3b37743f9653","year":2024},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.856037Z"},"links":{"cited_paper":"/paper/2401.04575","citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:b5b401cc8135248694d78e876e0ae7704278b830e3a41889a8d2ef006231634d","observation_id":"54f10874-2138-4c03-9c82-14b38eb9cb4b","resolution":{"observed_at":"2026-08-15T17:51:43.176356Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.688999Z","title":"Lima: Less is more for alignment,","venue":null,"work_id":"ebd03d91-627d-47e8-bd22-9c8cd670329f","year":2023},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.872904Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:37030b8483542fb4a0f927b81f8056f02325395bb58b6acd01bed9a879a91526","observation_id":"2ec930d8-ce85-4785-bf34-a4aa211b036f","resolution":{"observed_at":"2026-08-15T17:51:43.693170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.676986Z","title":"Agarwal and D","venue":null,"work_id":"4e3fe269-e83a-42e6-a888-7a74bf9a0fa4","year":null},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.876778Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:2645ee5a26378bddaad5c14c57259e9ca132301e29a05835c23bd96c360f9432","observation_id":"00ccbdd9-15cd-48ed-8bc3-9d6e4dc55e88","resolution":{"observed_at":"2026-08-15T17:51:43.680958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.701015Z","title":"Visual instruction tuning,","venue":null,"work_id":"286471b1-8333-4de8-b6ed-c8eac6a023e7","year":2023},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.868943Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:af65f040d684a5f9ddf9df930c4d4ada4474486ec1575dd32fa9db1a7245b968","observation_id":"ed77cb0e-c99b-4a29-b816-52dd411f3a29","resolution":{"observed_at":"2026-08-15T17:51:43.704893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00253","last_updated":"2024-05-06T01:10:01Z","snapshot_observed_at":"2026-08-17T09:37:14.144521Z","submitted_at":"2024-02-01T00:33:21Z","title":"A Survey on Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00253","snapshot_observed_at":"2026-08-15T17:51:42.888839Z","title":"Liu et al., A survey on hallucination in large vision- language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.888839Z"},"links":{"cited_paper":"/paper/2402.00253","citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:1b2b8f7637126536e15f607a268f4996603bcb35257faf94f37f2ce9c145175f","observation_id":"9d9c0583-18e0-48b0-a1a4-381266f45c07","resolution":{"observed_at":"2026-08-15T17:51:42.888839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.665160Z","title":"On the origin of hallucinations in con- versational models: Is it the datasets or the models?","venue":null,"work_id":"b9d13acf-3062-46f8-92a7-45428c6ffcfa","year":2022},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.893005Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:87d24e341e1b148b694eb070a3e280368310f13d55cf515a39677d8583ee5553","observation_id":"c5d58d02-0272-421e-b5ab-3d5a4059181f","resolution":{"observed_at":"2026-08-15T17:51:43.669088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2502.09969","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.138927Z","title":"48550 / ARXIV","venue":null,"work_id":"8b8647c5-0c04-456f-939a-c15ca0ddf40f","year":null},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.880779Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:ca91286066252e61a7c821924c3cfa7beea613692882fa2b141868c65d9b688e","observation_id":"4b5aff2c-9fb3-422d-887f-aa0e71838b34","resolution":{"observed_at":"2026-08-15T17:51:43.145209Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12501","last_updated":"2024-02-19T20:08:48Z","snapshot_observed_at":"2026-08-16T14:17:11.528452Z","submitted_at":"2024-02-19T20:08:48Z","title":"Your Vision-Language Model Itself Is a Strong Filter: Towards High-Quality Instruction Tuning with Data Selection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12501","snapshot_observed_at":"2026-08-15T17:51:42.884682Z","title":"Chen et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.884682Z"},"links":{"cited_paper":"/paper/2402.12501","citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:4c1d62674f04f3ad0aa7e50ac399544a2e098807c8a46b0bb76e0c05eeda848d","observation_id":"a5b05a76-f4e4-4ee9-8d8f-eba98670ca9a","resolution":{"observed_at":"2026-08-15T17:51:42.884682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.640631Z","title":"MiniGPT-4: Enhancing vision-language understanding with advanced large language mod- els,","venue":null,"work_id":"19b35705-7fcc-42b9-8b8e-d569be76552b","year":2024},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.905045Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:6e07e4f610fcf60dd44c288715b5e459f0b6118193daa90af75ee57376dded64","observation_id":"9137c9a2-2555-463d-9124-98d294a67a3f","resolution":{"observed_at":"2026-08-15T17:51:43.644770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.628373Z","title":"Conceptual captions: A cleaned, hy- pernymed, image alt-text dataset for automatic image captioning,","venue":null,"work_id":"23efe3d1-ce52-45f8-b176-d834c91ca0cb","year":2018},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.909037Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:64487f39c41176f32b754fb3fe764ff5b73331e9fe7eb55a8471bba5cc03a5b8","observation_id":"b65c4bde-955a-4669-bced-69f5fb7df324","resolution":{"observed_at":"2026-08-15T17:51:43.632535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12067","last_updated":"2026-04-12T14:13:44Z","snapshot_observed_at":"2026-08-17T11:42:02.077158Z","submitted_at":"2023-08-23T11:27:30Z","title":"MM-LIMA: Less Is More for Alignment in Multi-Modal Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12067","snapshot_observed_at":"2026-08-15T17:51:42.896673Z","title":"Wei et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.896673Z"},"links":{"cited_paper":"/paper/2308.12067","citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:16d48018508cc60cd6e630faa842bc45dff1706b0b424dce5fb41b7c9502888f","observation_id":"f842be4f-5590-4ba2-a228-f4a8114b7da0","resolution":{"observed_at":"2026-08-15T17:51:42.896673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.652887Z","title":"Alpagasus: Training a better alpaca with fewer data,","venue":null,"work_id":"3ef3069a-7aac-4d61-b6db-3b9cca7b83f9","year":2024},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.900720Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:cba05d337f462be42db1235242dce31b70e767bd4b706e87cf555653d17723e2","observation_id":"86302a80-cbc6-4715-ac71-616b76a72c2a","resolution":{"observed_at":"2026-08-15T17:51:43.656968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.603378Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":"eb0d4e92-07bb-4bcb-b190-03fe2c04936a","year":2019},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.920881Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:cddb53ff87c1e4bcc0560550df417f31d25b4e114646a4d0f8903ac812c5bcf0","observation_id":"b7cf5628-da59-48db-85ee-ea0ce844e3bc","resolution":{"observed_at":"2026-08-15T17:51:43.607479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.578254Z","title":"A frustratingly simple approach for end-to-end image captioning,","venue":null,"work_id":"65493a18-8e52-4bed-a69b-0288d0f91d03","year":2022},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.928389Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:33aa33daa21c102e9e8dfff229324a405bfb2bb15b622bddb6139aa1384df3ed","observation_id":"4cd92eee-129b-4164-9e4e-b0d6cd0874c2","resolution":{"observed_at":"2026-08-15T17:51:43.582723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.615623Z","title":"Learning transferable visual mod- els from natural language supervision,","venue":null,"work_id":"cb625e1a-4136-4506-9858-9089d63c3c5e","year":2021},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.912892Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:3eeafcbc9022fa80b0b7e55df152e8f882b9d94e47cce61491cb105af59f0ceb","observation_id":"9b75eceb-4c74-4217-bd8a-9a4b8eece9c6","resolution":{"observed_at":"2026-08-15T17:51:43.620012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-15T17:51:42.916590Z","title":"Dosovitskiy et al., An image is worth 16x16 words: Transformers for image recognition at scale , 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.916590Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:11f7364ad6b2024bf7cdf0bcc81bb64978767abba529b7725f6c87cd794dee45","observation_id":"5a46c7e5-1d23-4691-88a8-cc08dfe4f5cf","resolution":{"observed_at":"2026-08-15T17:51:42.916590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.591082Z","title":"Available: https://cdn.openai","venue":null,"work_id":"f6592876-619b-4227-b06a-a1c05df63bb4","year":null},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.924572Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:ca9f59ab249b54d1643a876877712848bd5047597043b95fa245f39a74634e23","observation_id":"ec5e046e-f3f5-49b7-8e2c-91e7c739fae6","resolution":{"observed_at":"2026-08-15T17:51:43.595346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.565644Z","title":"A survey on enhancing image caption- ing with advanced strategies and techniques,","venue":null,"work_id":"9da4b3a8-a70d-4c23-a45d-4e0bf2d98a49","year":2025},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.932021Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:778e2cdaf8af07101d2be6077eeb4f94ecd27040011cbcf6a87a9cb7a2e07d8a","observation_id":"a81406a3-565c-48ea-904b-866e719a8904","resolution":{"observed_at":"2026-08-15T17:51:43.569802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.551481Z","title":"SciPy 1.0: Fundamental Algorithms for Scientific Computing in Python,","venue":null,"work_id":"e472e4cb-6113-4790-b258-1defad90d5f4","year":2020},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.939404Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:96570bdfbe8142c349cc2879a2ad4eac3edd4e4eef137d3997cd064bfb36a30b","observation_id":"2a3bc4dd-9bb9-48eb-ad34-b5cb2aa1b190","resolution":{"observed_at":"2026-08-15T17:51:43.555538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.05919","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.393371Z","title":"32604 / cmes","venue":null,"work_id":"c1d1c1ae-864e-4ddc-86b6-2436c271ca0b","year":2025},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":1506,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.935633Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:c39762c0e0bd8921bb1326230e412bafde06b49fd74cc2add0eb473792ef8bd2","observation_id":"57702283-bbd4-4e3a-b763-cefa40cf6a70","resolution":{"observed_at":"2026-08-15T17:51:43.399739Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T17:51:42.801311Z","title":"48550 / ARXIV","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.801311Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:f201f3561f8ee0a22b8cffc8657e1c95498f1fcfc67a3ba2b44c7662199c2ca2","observation_id":"a99d609a-3c26-45d0-afd2-016f4732510b","resolution":{"observed_at":"2026-08-15T17:51:42.801311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2502.01341","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.256253Z","title":"48550 / ARXIV","venue":null,"work_id":"ce6d83cd-4420-4bc6-8ead-a4ff6cd6290c","year":null},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.826469Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:3647cd640c7885d67d9c0b31cf340ac6576652505f4c166bbcbb258a518b4b0e","observation_id":"bb5a050c-5f47-489a-928f-c215d8208db3","resolution":{"observed_at":"2026-08-15T17:51:43.260921Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":11,"verified_exact":6,"verified_fuzzy":19},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2507.20156."}