{"as_of":"2026-08-06T17:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d821e2143e2c17c27c819f5ecf16907887992d3ecc5953ba2a42c655c52f3283","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:26:35.252979Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:39:50.777451Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.08478","last_updated":"2024-06-18T11:47:26Z","snapshot_observed_at":"2026-07-06T18:29:49.284504Z","submitted_at":"2024-06-12T17:59:07Z","title":"What If We Recaption Billions of Web Images with LLaMA-3?","version":2},"cited_work":{"arxiv_id":"2406.08478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08478","snapshot_observed_at":"2026-07-04T13:39:50.777451Z","title":"What if we recaption billions of web images with llama-3?","venue":null,"work_id":"54e09996-e9d1-443c-8378-ac0c34f2f4e9","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2406.08478","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:23ff80c3cc08e1e54b62ef24e926d9d2820d84cf422a505d5d4c6612c141f55f","observation_id":"8f9c9d56-a50f-40e0-886d-c723d7ea8aed","resolution":{"observed_at":"2026-05-19T07:52:10.869347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08478","last_updated":"2024-06-18T11:47:26Z","snapshot_observed_at":"2026-07-06T18:29:49.284504Z","submitted_at":"2024-06-12T17:59:07Z","title":"What If We Recaption Billions of Web Images with LLaMA-3?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08478","snapshot_observed_at":"2026-08-06T16:26:35.252979Z","title":"What if we recaption billions of web images with llama-3? CoRR, abs/2406.08478, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13568","last_updated":"2025-07-29T03:29:57Z","snapshot_observed_at":"2026-08-06T16:19:31.949430Z","submitted_at":"2025-07-17T23:08:29Z","title":"LoRA-Loop: Closing the Synthetic Replay Cycle for Continual VLM Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:26:35.252979Z"},"links":{"cited_paper":"/paper/2406.08478","citing_paper":"/paper/2507.13568"},"observation_digest":"sha256:24ab7bb8a23a180939cdbc91f336f17b8e746eb403e151717f77a4662fdc7cd3","observation_id":"4337a5b9-0985-43a8-89b6-cff4964300a7","resolution":{"observed_at":"2026-08-06T16:26:35.252979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08478","last_updated":"2024-06-18T11:47:26Z","snapshot_observed_at":"2026-07-06T18:29:49.284504Z","submitted_at":"2024-06-12T17:59:07Z","title":"What If We Recaption Billions of Web Images with LLaMA-3?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08478","snapshot_observed_at":"2026-08-06T11:46:45.400816Z","title":"What if we recaption billions of web images with llama-3? arXiv preprint arXiv:2406.08478,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.400816Z"},"links":{"cited_paper":"/paper/2406.08478","citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:eb1a1240273aa8a43ea54b5c147055f1ef7efd5af8669adbbdde4886b55f3725","observation_id":"bca85c64-9114-4285-a012-c084a8a858ba","resolution":{"observed_at":"2026-08-06T11:46:45.400816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08478","last_updated":"2024-06-18T11:47:26Z","snapshot_observed_at":"2026-07-06T18:29:49.284504Z","submitted_at":"2024-06-12T17:59:07Z","title":"What If We Recaption Billions of Web Images with LLaMA-3?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08478","snapshot_observed_at":"2026-08-05T13:05:54.478225Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-05T13:05:51.875633Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:54.478225Z"},"links":{"cited_paper":"/paper/2406.08478","citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:d8780698890a2b42baa7a720e2109f87403899efd41c5856e80b8768dd7bbc79","observation_id":"6c41d5a6-4e76-40c6-adc6-d2060604eea6","resolution":{"observed_at":"2026-08-05T13:05:54.478225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08478","last_updated":"2024-06-18T11:47:26Z","snapshot_observed_at":"2026-07-06T18:29:49.284504Z","submitted_at":"2024-06-12T17:59:07Z","title":"What If We Recaption Billions of Web Images with LLaMA-3?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08478","snapshot_observed_at":"2026-08-05T12:22:35.506534Z","title":"What if we recaption billions of web images with llama-3? arXiv preprint arXiv:2406.08478,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.506534Z"},"links":{"cited_paper":"/paper/2406.08478","citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:8baebb3d0836972070edc31f417983c7f99d45415691cfefe503269573356482","observation_id":"2124472e-1761-4fa3-88f0-08854232d528","resolution":{"observed_at":"2026-08-05T12:22:35.506534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08478","last_updated":"2024-06-18T11:47:26Z","snapshot_observed_at":"2026-07-06T18:29:49.284504Z","submitted_at":"2024-06-12T17:59:07Z","title":"What If We Recaption Billions of Web Images with LLaMA-3?","version":2},"cited_work":{"arxiv_id":"2406.08478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08478","snapshot_observed_at":"2026-07-04T13:39:50.777451Z","title":"What if we recaption billions of web images with llama-3?","venue":null,"work_id":"54e09996-e9d1-443c-8378-ac0c34f2f4e9","year":2024},"citing_paper":{"arxiv_id":"2512.22437","last_updated":"2026-04-10T13:28:12Z","snapshot_observed_at":"2026-07-06T22:40:07.339525Z","submitted_at":"2025-12-27T02:18:36Z","title":"EmoCtrl: Controllable Emotional Image Content Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T19:35:52.111730Z"},"links":{"cited_paper":"/paper/2406.08478","citing_paper":"/paper/2512.22437"},"observation_digest":"sha256:cbf28d5e54dc1333cd310af3c34a9d43eb304e5b1d2ee1d07dd6a892b89c50ce","observation_id":"7d6bf0c8-dd73-4530-9f8d-6fdb9dc9c34e","resolution":{"observed_at":"2026-05-16T19:38:20.764959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08478","last_updated":"2024-06-18T11:47:26Z","snapshot_observed_at":"2026-07-06T18:29:49.284504Z","submitted_at":"2024-06-12T17:59:07Z","title":"What If We Recaption Billions of Web Images with LLaMA-3?","version":2},"cited_work":{"arxiv_id":"2406.08478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08478","snapshot_observed_at":"2026-07-04T13:39:50.777451Z","title":"What if we recaption billions of web images with llama-3?","venue":null,"work_id":"54e09996-e9d1-443c-8378-ac0c34f2f4e9","year":2024},"citing_paper":{"arxiv_id":"2606.26794","last_updated":"2026-06-25T09:27:54Z","snapshot_observed_at":"2026-08-03T16:40:37.506200Z","submitted_at":"2026-06-25T09:27:54Z","title":"ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-26T05:03:15.044146Z"},"links":{"cited_paper":"/paper/2406.08478","citing_paper":"/paper/2606.26794"},"observation_digest":"sha256:c2ced59820b73cf3a3ff6ab5ea8e563a6c37757517f51ebd8bc052c18bec0bdd","observation_id":"00cb32ef-8ef2-4f87-82cc-ab0da037548a","resolution":{"observed_at":"2026-07-04T13:39:50.779014Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08478","last_updated":"2024-06-18T11:47:26Z","snapshot_observed_at":"2026-07-06T18:29:49.284504Z","submitted_at":"2024-06-12T17:59:07Z","title":"What If We Recaption Billions of Web Images with LLaMA-3?","version":2},"cited_work":{"arxiv_id":"2406.08478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08478","snapshot_observed_at":"2026-07-04T13:39:50.777451Z","title":"What if we recaption billions of web images with llama-3?","venue":null,"work_id":"54e09996-e9d1-443c-8378-ac0c34f2f4e9","year":2024},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-06-30T20:49:34Z","snapshot_observed_at":"2026-08-02T23:02:11.703134Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":1},"reference_index":163,"source":"pdf_text","source_observed_at":"2026-06-30T01:16:16.834861Z"},"links":{"cited_paper":"/paper/2406.08478","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:6fb5c2ebe9ad45dad5682eaf09ea47f64c031e4f12d6d27590767149ba75be61","observation_id":"f12471f3-3738-490c-a776-f092d4b9993c","resolution":{"observed_at":"2026-07-01T15:45:47.745660Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08478","last_updated":"2024-06-18T11:47:26Z","snapshot_observed_at":"2026-07-06T18:29:49.284504Z","submitted_at":"2024-06-12T17:59:07Z","title":"What If We Recaption Billions of Web Images with LLaMA-3?","version":2},"cited_work":{"arxiv_id":"2406.08478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08478","snapshot_observed_at":"2026-07-04T13:39:50.777451Z","title":"What if we recaption billions of web images with llama-3?","venue":null,"work_id":"54e09996-e9d1-443c-8378-ac0c34f2f4e9","year":2024},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-06-30T20:49:34Z","snapshot_observed_at":"2026-08-02T23:02:11.703134Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":2},"reference_index":163,"source":"pdf_text","source_observed_at":"2026-07-02T21:10:10.548489Z"},"links":{"cited_paper":"/paper/2406.08478","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:41be2c3b10bbf88c89eca05fe1ea272c4fee43e1386bb00d9a45028fb06a037b","observation_id":"4f5c73a0-66bb-41d7-b1b2-e33e7ea1a405","resolution":{"observed_at":"2026-07-02T21:17:23.986368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2406.08478/citation-record","integrity":"/paper/2406.08478/integrity","json":"/paper/2406.08478/citation-record.json","paper":"/paper/2406.08478"},"outbound":[],"paper":{"arxiv_id":"2406.08478","last_updated":"2024-06-18T11:47:26Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T18:29:49.284504Z","submitted_at":"2024-06-12T17:59:07Z","title":"What If We Recaption Billions of Web Images with LLaMA-3?"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2406.08478."}