{"as_of":"2026-08-08T22:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9bccbf66f9d8b3ab3c73ff50a42b853c451842242477550087614efa9313c24c","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T18:51:10.479437Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.10250/citation-record","integrity":"/paper/2502.10250/integrity","json":"/paper/2502.10250/citation-record.json","paper":"/paper/2502.10250"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T18:51:10.396754Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10250","last_updated":"2025-02-24T10:58:12Z","snapshot_observed_at":"2026-08-07T18:45:36.373287Z","submitted_at":"2025-02-14T15:59:33Z","title":"VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T18:51:10.396754Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.10250"},"observation_digest":"sha256:56a4f260944ab9dfde27962dffd3e1c4a04aec42f63860fd8212041399925aa1","observation_id":"f54d4585-f05a-4c98-b478-db00235b1ff4","resolution":{"observed_at":"2026-08-07T18:51:10.396754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12871","last_updated":"2024-12-31T07:56:13Z","snapshot_observed_at":"2026-07-06T16:22:21.746857Z","submitted_at":"2023-09-22T13:52:42Z","title":"AnglE-optimized Text Embeddings","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12871","snapshot_observed_at":"2026-08-07T18:51:10.422113Z","title":"Angle-optimized text embeddings","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10250","last_updated":"2025-02-24T10:58:12Z","snapshot_observed_at":"2026-08-07T18:45:36.373287Z","submitted_at":"2025-02-14T15:59:33Z","title":"VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T18:51:10.422113Z"},"links":{"cited_paper":"/paper/2309.12871","citing_paper":"/paper/2502.10250"},"observation_digest":"sha256:1cafea99987a3f4d63ac7a069c8cb7843a073ab95bd97c3282519d4a2e2cf16a","observation_id":"37a019c0-ccec-4600-a883-838bbd380c5f","resolution":{"observed_at":"2026-08-07T18:51:10.422113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02506","last_updated":"2024-01-18T22:09:40Z","snapshot_observed_at":"2026-08-06T04:09:30.056285Z","submitted_at":"2023-03-04T21:22:47Z","title":"Prismer: A Vision-Language Model with Multi-Task Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.02506","snapshot_observed_at":"2026-08-07T18:51:10.428909Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.10250","last_updated":"2025-02-24T10:58:12Z","snapshot_observed_at":"2026-08-07T18:45:36.373287Z","submitted_at":"2025-02-14T15:59:33Z","title":"VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T18:51:10.428909Z"},"links":{"cited_paper":"/paper/2303.02506","citing_paper":"/paper/2502.10250"},"observation_digest":"sha256:d0358631b09fbca378097b22ec791aae4164ce103c92768162da8f0e264f60d4","observation_id":"cbe8465b-666e-4474-959d-90bd695456de","resolution":{"observed_at":"2026-08-07T18:51:10.428909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17718","last_updated":"2023-11-15T14:57:32Z","snapshot_observed_at":"2026-07-06T15:34:29.143691Z","submitted_at":"2023-05-28T13:16:03Z","title":"FuseCap: Leveraging Large Language Models for Enriched Fused Image Captions","version":2},"cited_work":{"arxiv_id":"2305.17718","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.17718","snapshot_observed_at":"2026-08-07T18:51:10.623586Z","title":"FuseCap: Leveraging Large Language Models for Enriched Fused Image Captions","venue":"cs.CV","work_id":"439c9637-20c3-468f-8e4c-9bae380660cc","year":2023},"citing_paper":{"arxiv_id":"2502.10250","last_updated":"2025-02-24T10:58:12Z","snapshot_observed_at":"2026-08-07T18:45:36.373287Z","submitted_at":"2025-02-14T15:59:33Z","title":"VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T18:51:10.437362Z"},"links":{"cited_paper":"/paper/2305.17718","citing_paper":"/paper/2502.10250"},"observation_digest":"sha256:fc54f06becf7a849c855055c6bab3219feed0d1ac6743fea47c44f78343cf70e","observation_id":"b04e03f2-cdb9-478c-abd7-829f9ec0989f","resolution":{"observed_at":"2026-08-07T18:51:10.631920Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-07T18:51:10.445511Z","title":"Gemma: Open models based on gemini research and technology","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10250","last_updated":"2025-02-24T10:58:12Z","snapshot_observed_at":"2026-08-07T18:45:36.373287Z","submitted_at":"2025-02-14T15:59:33Z","title":"VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T18:51:10.445511Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2502.10250"},"observation_digest":"sha256:213bf4f21ab49b1840cf12e4428ab3b896dabbb45fa4d283b879126669bbf10a","observation_id":"5d72e60f-2d8a-4101-8f88-827bb158a8cc","resolution":{"observed_at":"2026-08-07T18:51:10.445511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T18:51:10.452158Z","title":"Llama 2: Open founda- tion and fine-tuned chat models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10250","last_updated":"2025-02-24T10:58:12Z","snapshot_observed_at":"2026-08-07T18:45:36.373287Z","submitted_at":"2025-02-14T15:59:33Z","title":"VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T18:51:10.452158Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.10250"},"observation_digest":"sha256:0daf6cd45687f2daf3c284b69717f0ee0a32249cfd2f7b16c7286bd55dccb6da","observation_id":"4b7d06a7-4eb2-4aba-9c9f-11f48fbf400a","resolution":{"observed_at":"2026-08-07T18:51:10.452158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11235","last_updated":"2024-03-16T04:32:25Z","snapshot_observed_at":"2026-08-07T05:19:58.002826Z","submitted_at":"2023-09-20T11:54:40Z","title":"OpenChat: Advancing Open-source Language Models with Mixed-Quality Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11235","snapshot_observed_at":"2026-08-07T18:51:10.458835Z","title":"Openchat: Ad- vancing open-source language models with mixed-quality data.arXiv preprint arXiv:2309.11235,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10250","last_updated":"2025-02-24T10:58:12Z","snapshot_observed_at":"2026-08-07T18:45:36.373287Z","submitted_at":"2025-02-14T15:59:33Z","title":"VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T18:51:10.458835Z"},"links":{"cited_paper":"/paper/2309.11235","citing_paper":"/paper/2502.10250"},"observation_digest":"sha256:52ef188636c02d44d2e5b6acdbd17e8fd10140fcc9ae1ac59d0675a377fbbb96","observation_id":"b49e3b7c-8e44-478c-97c4-d55bc2c8562b","resolution":{"observed_at":"2026-08-07T18:51:10.458835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","snapshot_observed_at":"2026-07-06T15:56:25.975005Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10802","snapshot_observed_at":"2026-08-07T18:51:10.466981Z","title":"Meta-transformer: A unified framework for multimodal learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10250","last_updated":"2025-02-24T10:58:12Z","snapshot_observed_at":"2026-08-07T18:45:36.373287Z","submitted_at":"2025-02-14T15:59:33Z","title":"VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T18:51:10.466981Z"},"links":{"cited_paper":"/paper/2307.10802","citing_paper":"/paper/2502.10250"},"observation_digest":"sha256:830900bdad17b76b86756e0eeea2775b374194aafd243c210aeafc2891edb7d2","observation_id":"7d3b72f3-9ac3-47dc-971f-7913d16d98b5","resolution":{"observed_at":"2026-08-07T18:51:10.466981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T18:51:10.473670Z","title":"Minigpt-4: En- hancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10250","last_updated":"2025-02-24T10:58:12Z","snapshot_observed_at":"2026-08-07T18:45:36.373287Z","submitted_at":"2025-02-14T15:59:33Z","title":"VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T18:51:10.473670Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2502.10250"},"observation_digest":"sha256:322c6b65d8b54f732151119660f636303d2100c8a8def2a6f37c2cd1461b2371","observation_id":"2b7debf4-1f14-4b51-964a-345353c0c1a1","resolution":{"observed_at":"2026-08-07T18:51:10.473670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:51:10.766286Z","title":"(a) Distribution of Number of Tokens in the Source Context","venue":null,"work_id":"0cd516a7-6447-4c6c-9b8a-52fe9a4d84a6","year":2025},"citing_paper":{"arxiv_id":"2502.10250","last_updated":"2025-02-24T10:58:12Z","snapshot_observed_at":"2026-08-07T18:45:36.373287Z","submitted_at":"2025-02-14T15:59:33Z","title":"VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T18:51:10.479437Z"},"links":{"citing_paper":"/paper/2502.10250"},"observation_digest":"sha256:8eb2cacc06bdc04d5faa3eb79622a847d26ceeffe51272cf4682fe4087d9f66c","observation_id":"4c7a2227-17d8-4acd-839b-273b0c428175","resolution":{"observed_at":"2026-08-07T18:51:10.771807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-08T17:33:57.727194Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-07T18:51:10.414354Z","title":"Obelics: An open web-scale filtered dataset of interleaved image-text documents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10250","last_updated":"2025-02-24T10:58:12Z","snapshot_observed_at":"2026-08-07T18:45:36.373287Z","submitted_at":"2025-02-14T15:59:33Z","title":"VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T18:51:10.414354Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2502.10250"},"observation_digest":"sha256:20d6407b50200f67868e5ef7d66ad2af69c04043ffb093ee715ee8ea82dd0544","observation_id":"f007f6f7-fc3f-4d62-8d85-6c88dc5bb315","resolution":{"observed_at":"2026-08-07T18:51:10.414354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-07T18:51:10.381594Z","title":"Allava: Harnessing gpt4v-synthesized data for a lite vision-language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10250","last_updated":"2025-02-24T10:58:12Z","snapshot_observed_at":"2026-08-07T18:45:36.373287Z","submitted_at":"2025-02-14T15:59:33Z","title":"VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T18:51:10.381594Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2502.10250"},"observation_digest":"sha256:38df4ad9b863c2e57d590e0a554f1abf06412e92ab95a8a5e406c70d7a6be3ca","observation_id":"f21da683-72c6-467f-b430-15aeeb20059e","resolution":{"observed_at":"2026-08-07T18:51:10.381594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:51:10.785234Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"f774c071-2310-4e82-93e9-4fb9df67bee1","year":2016},"citing_paper":{"arxiv_id":"2502.10250","last_updated":"2025-02-24T10:58:12Z","snapshot_observed_at":"2026-08-07T18:45:36.373287Z","submitted_at":"2025-02-14T15:59:33Z","title":"VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T18:51:10.404020Z"},"links":{"citing_paper":"/paper/2502.10250"},"observation_digest":"sha256:b4bb9e910be823441ca53ce47f456d549f0ab8d9eb645b423097b89d62002fb9","observation_id":"a1df0bbb-20d8-44a9-8860-606321539e65","resolution":{"observed_at":"2026-08-07T18:51:10.791389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-07T18:51:10.388827Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10250","last_updated":"2025-02-24T10:58:12Z","snapshot_observed_at":"2026-08-07T18:45:36.373287Z","submitted_at":"2025-02-14T15:59:33Z","title":"VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T18:51:10.388827Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2502.10250"},"observation_digest":"sha256:39ec73e7c5f342e74d893d890bf183a6a6ac5f998da3c703b4b59262b885ae60","observation_id":"087f2118-5123-4cfa-a18c-9d377f22aa4b","resolution":{"observed_at":"2026-08-07T18:51:10.388827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.10250","last_updated":"2025-02-24T10:58:12Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T18:45:36.373287Z","submitted_at":"2025-02-14T15:59:33Z","title":"VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2502.10250."}