{"as_of":"2026-08-23T11:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a48c710ebc46fc9440bd77c40809289e8d10e3383babe6ed054cae316cbd23f3","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:18:27.679231Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.05040/citation-record","integrity":"/paper/2505.05040/integrity","json":"/paper/2505.05040/citation-record.json","paper":"/paper/2505.05040"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:18:27.476642Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.05040","last_updated":"2025-05-08T08:23:20Z","snapshot_observed_at":"2026-08-20T13:36:24.741818Z","submitted_at":"2025-05-08T08:23:20Z","title":"Image-Text Relation Prediction for Multilingual Tweets","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T23:18:27.476642Z"},"links":{"citing_paper":"/paper/2505.05040"},"observation_digest":"sha256:eb6896cf6f9ae57d7e4a06b74324a63bf159d9c2580d66f0a70b260622dfd2b0","observation_id":"7fe6c9c8-5327-4cf3-b08f-0a01dfb0a182","resolution":{"observed_at":"2026-08-15T23:18:27.476642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:18:27.554419Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.05040","last_updated":"2025-05-08T08:23:20Z","snapshot_observed_at":"2026-08-20T13:36:24.741818Z","submitted_at":"2025-05-08T08:23:20Z","title":"Image-Text Relation Prediction for Multilingual Tweets","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T23:18:27.554419Z"},"links":{"citing_paper":"/paper/2505.05040"},"observation_digest":"sha256:0cabcc234c3275e38d08e0f0cccf3aa8e5a7416b6e677c7a101dfaece4b754cc","observation_id":"49c3bd12-eb0c-44f2-bed4-e0a6bb34c83d","resolution":{"observed_at":"2026-08-15T23:18:27.554419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-15T23:18:27.560387Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05040","last_updated":"2025-05-08T08:23:20Z","snapshot_observed_at":"2026-08-20T13:36:24.741818Z","submitted_at":"2025-05-08T08:23:20Z","title":"Image-Text Relation Prediction for Multilingual Tweets","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T23:18:27.560387Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.05040"},"observation_digest":"sha256:b0cf2fdb6a8136ebd90445295f726d10f4f466ecf00d32e04e5bb23ea7ecb5ba","observation_id":"b7000762-ebd1-4c13-bb7c-0c07109c8ff3","resolution":{"observed_at":"2026-08-15T23:18:27.560387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-15T23:18:27.567913Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05040","last_updated":"2025-05-08T08:23:20Z","snapshot_observed_at":"2026-08-20T13:36:24.741818Z","submitted_at":"2025-05-08T08:23:20Z","title":"Image-Text Relation Prediction for Multilingual Tweets","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T23:18:27.567913Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.05040"},"observation_digest":"sha256:b72d3c45d179957919dcae6ca06632ceabc4fcec4b0cf4b5c193e9d3c870cca8","observation_id":"5a2243d6-fe46-475d-9d58-cccc7551ade2","resolution":{"observed_at":"2026-08-15T23:18:27.567913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T23:18:27.575335Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05040","last_updated":"2025-05-08T08:23:20Z","snapshot_observed_at":"2026-08-20T13:36:24.741818Z","submitted_at":"2025-05-08T08:23:20Z","title":"Image-Text Relation Prediction for Multilingual Tweets","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T23:18:27.575335Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.05040"},"observation_digest":"sha256:4fa5f45995b356a26ee9465a6b67d099aaa4af3d3c609813baebf2d6bdcdc22a","observation_id":"1666e964-2776-43ce-9c3c-97c5f16179e3","resolution":{"observed_at":"2026-08-15T23:18:27.575335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-15T23:18:27.581476Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05040","last_updated":"2025-05-08T08:23:20Z","snapshot_observed_at":"2026-08-20T13:36:24.741818Z","submitted_at":"2025-05-08T08:23:20Z","title":"Image-Text Relation Prediction for Multilingual Tweets","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T23:18:27.581476Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.05040"},"observation_digest":"sha256:b91dad4a8f30e2201b94c9db6471a7bcd153f66762aceb216e41b7ce31d8e6f5","observation_id":"3a24697f-4696-4ce2-b0a4-8f482405c723","resolution":{"observed_at":"2026-08-15T23:18:27.581476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:18:27.587122Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05040","last_updated":"2025-05-08T08:23:20Z","snapshot_observed_at":"2026-08-20T13:36:24.741818Z","submitted_at":"2025-05-08T08:23:20Z","title":"Image-Text Relation Prediction for Multilingual Tweets","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T23:18:27.587122Z"},"links":{"citing_paper":"/paper/2505.05040"},"observation_digest":"sha256:58f2e7334706c6e6510613c6ddb23816e5fab6adfa37a4ba3e62a04add17c8f0","observation_id":"e4b338b1-2d6a-4096-b9ec-929d065998e3","resolution":{"observed_at":"2026-08-15T23:18:27.587122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:18:27.592243Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.05040","last_updated":"2025-05-08T08:23:20Z","snapshot_observed_at":"2026-08-20T13:36:24.741818Z","submitted_at":"2025-05-08T08:23:20Z","title":"Image-Text Relation Prediction for Multilingual Tweets","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T23:18:27.592243Z"},"links":{"citing_paper":"/paper/2505.05040"},"observation_digest":"sha256:ee331f7ab0a2d881b315917cc2febcffe4b0c0c1fa3ed6f92efb921ae5ba123f","observation_id":"67171a4f-ed8f-4116-8667-69037b6919a0","resolution":{"observed_at":"2026-08-15T23:18:27.592243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:18:27.597771Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.05040","last_updated":"2025-05-08T08:23:20Z","snapshot_observed_at":"2026-08-20T13:36:24.741818Z","submitted_at":"2025-05-08T08:23:20Z","title":"Image-Text Relation Prediction for Multilingual Tweets","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T23:18:27.597771Z"},"links":{"citing_paper":"/paper/2505.05040"},"observation_digest":"sha256:4e7428ae4af99196094fcf1e55eb61e34f90f1df49e65a8d4923540479a27b84","observation_id":"2046a086-0b31-4ddc-b8d0-639c3bc1be74","resolution":{"observed_at":"2026-08-15T23:18:27.597771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:18:27.603002Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.05040","last_updated":"2025-05-08T08:23:20Z","snapshot_observed_at":"2026-08-20T13:36:24.741818Z","submitted_at":"2025-05-08T08:23:20Z","title":"Image-Text Relation Prediction for Multilingual Tweets","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T23:18:27.603002Z"},"links":{"citing_paper":"/paper/2505.05040"},"observation_digest":"sha256:4d0ce338a4c2d388bc0fcfb840bf18b2175609bb4afad44988593633b0fe2c8a","observation_id":"28e34c86-9794-4d66-8044-9c1fe9ee6924","resolution":{"observed_at":"2026-08-15T23:18:27.603002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:18:27.934627Z","title":null,"venue":null,"work_id":"905d5d93-90aa-446e-b3ec-00211c15da3a","year":2024},"citing_paper":{"arxiv_id":"2505.05040","last_updated":"2025-05-08T08:23:20Z","snapshot_observed_at":"2026-08-20T13:36:24.741818Z","submitted_at":"2025-05-08T08:23:20Z","title":"Image-Text Relation Prediction for Multilingual Tweets","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T23:18:27.635159Z"},"links":{"citing_paper":"/paper/2505.05040"},"observation_digest":"sha256:fad44cda69a0845f45f00ec6996a0968da9332b40352e8b21af9f49b5cfd6d1b","observation_id":"9a6054fd-98e9-403c-8990-98c4b5068cf4","resolution":{"observed_at":"2026-08-15T23:18:27.979232Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/p19-1272","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:18:27.709758Z","title":null,"venue":null,"work_id":"5e32ef84-f413-40ef-9886-8e0dfbea1c85","year":2019},"citing_paper":{"arxiv_id":"2505.05040","last_updated":"2025-05-08T08:23:20Z","snapshot_observed_at":"2026-08-20T13:36:24.741818Z","submitted_at":"2025-05-08T08:23:20Z","title":"Image-Text Relation Prediction for Multilingual Tweets","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T23:18:27.668460Z"},"links":{"citing_paper":"/paper/2505.05040"},"observation_digest":"sha256:e424673b448efd33564f1f5115fc62a62c148a604e86f409bec81f7d7da9284c","observation_id":"9b4ce6b8-b676-4064-9a49-128a7ff25869","resolution":{"observed_at":"2026-08-15T23:18:27.715860Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:18:27.673831Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.05040","last_updated":"2025-05-08T08:23:20Z","snapshot_observed_at":"2026-08-20T13:36:24.741818Z","submitted_at":"2025-05-08T08:23:20Z","title":"Image-Text Relation Prediction for Multilingual Tweets","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T23:18:27.673831Z"},"links":{"citing_paper":"/paper/2505.05040"},"observation_digest":"sha256:e19177036a173c5f3d3afc59c70ef6aeccf2ae7bee3a1dd788722142c9a67fe9","observation_id":"7683990e-3543-49bf-9c93-5e598a5a6fa5","resolution":{"observed_at":"2026-08-15T23:18:27.673831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13164","last_updated":"2025-03-31T20:03:34Z","snapshot_observed_at":"2026-08-20T13:36:14.494449Z","submitted_at":"2024-03-19T21:31:56Z","title":"VL-ICL Bench: The Devil in the Details of Multimodal In-Context Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13164","snapshot_observed_at":"2026-08-15T23:18:27.679231Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05040","last_updated":"2025-05-08T08:23:20Z","snapshot_observed_at":"2026-08-20T13:36:24.741818Z","submitted_at":"2025-05-08T08:23:20Z","title":"Image-Text Relation Prediction for Multilingual Tweets","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T23:18:27.679231Z"},"links":{"cited_paper":"/paper/2403.13164","citing_paper":"/paper/2505.05040"},"observation_digest":"sha256:ffca9ad43ecc7419faad990c354ae60965c028260ba0757b982f08e7a8234876","observation_id":"37dfd2de-3af0-4c01-b9b1-233381126529","resolution":{"observed_at":"2026-08-15T23:18:27.679231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.05040","last_updated":"2025-05-08T08:23:20Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-20T13:36:24.741818Z","submitted_at":"2025-05-08T08:23:20Z","title":"Image-Text Relation Prediction for Multilingual Tweets"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2505.05040."}