{"as_of":"2026-08-12T22:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0d973912912cea692a5aa62cd6c52cb413ca2a3f6a151a08dec8a28d95cbb572","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:44:35.335823Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.10497","last_updated":"2025-05-26T17:20:21Z","snapshot_observed_at":"2026-08-07T17:06:40.468097Z","submitted_at":"2025-03-13T15:59:20Z","title":"MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10497","snapshot_observed_at":"2026-08-07T14:44:35.335823Z","title":"MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation.arXiv preprint arXiv:2503.10497,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18102","last_updated":"2026-05-30T13:29:55Z","snapshot_observed_at":"2026-08-07T14:33:15.240605Z","submitted_at":"2025-05-23T16:57:34Z","title":"CapBencher: Give Your LLM Benchmark a Built-in Alarm for Test-Set Overfitting","version":7},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:35.335823Z"},"links":{"cited_paper":"/paper/2503.10497","citing_paper":"/paper/2505.18102"},"observation_digest":"sha256:f785e75e2ceab18277a605f8ccaa4a8f5173c50bead3dc1c7832c0c4a3160813","observation_id":"0cfa8bad-7bbd-4edb-9bd0-d17271414661","resolution":{"observed_at":"2026-08-07T14:44:35.335823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10497","last_updated":"2025-05-26T17:20:21Z","snapshot_observed_at":"2026-08-07T17:06:40.468097Z","submitted_at":"2025-03-13T15:59:20Z","title":"MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10497","snapshot_observed_at":"2026-08-06T14:53:02.432419Z","title":"Mmlu-prox: A multilingual benchmark for advanced large language model evaluation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17476","last_updated":"2025-07-23T12:56:31Z","snapshot_observed_at":"2026-08-11T12:24:05.206435Z","submitted_at":"2025-07-23T12:56:31Z","title":"MultiNRC: A Challenging and Native Multilingual Reasoning Evaluation Benchmark for LLMs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T14:53:02.432419Z"},"links":{"cited_paper":"/paper/2503.10497","citing_paper":"/paper/2507.17476"},"observation_digest":"sha256:03e6032b3e1d34363da5fce2878ee107dcf225b1d767455f4db60ae97427c5da","observation_id":"b4a59685-f744-4586-8b85-b098e6b5a1e0","resolution":{"observed_at":"2026-08-06T14:53:02.432419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10497","last_updated":"2025-05-26T17:20:21Z","snapshot_observed_at":"2026-08-07T17:06:40.468097Z","submitted_at":"2025-03-13T15:59:20Z","title":"MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10497","snapshot_observed_at":"2026-08-04T23:43:02.470776Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06401","last_updated":"2025-09-08T07:47:00Z","snapshot_observed_at":"2026-08-09T16:12:17.027015Z","submitted_at":"2025-09-08T07:47:00Z","title":"Do LLMs exhibit the same commonsense capabilities across languages?","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T23:43:02.470776Z"},"links":{"cited_paper":"/paper/2503.10497","citing_paper":"/paper/2509.06401"},"observation_digest":"sha256:7ace8f02ccfc849d303713d806fbfe1bd612848243be70df57660f5b17fc2f62","observation_id":"b62f5b2a-4507-44ed-9183-e799adadf83b","resolution":{"observed_at":"2026-08-04T23:43:02.470776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10497","last_updated":"2025-05-26T17:20:21Z","snapshot_observed_at":"2026-08-07T17:06:40.468097Z","submitted_at":"2025-03-13T15:59:20Z","title":"MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation","version":2},"cited_work":{"arxiv_id":"2503.10497","doi":"10.48550/arxiv.2503.10497","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10497","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.10497 , year=","venue":"ArXiv.org","work_id":"932058b2-29f2-4aaf-b5b0-4cebd458e179","year":2023},"citing_paper":{"arxiv_id":"2510.27269","last_updated":"2026-04-13T06:54:57Z","snapshot_observed_at":"2026-08-05T20:44:12.020817Z","submitted_at":"2025-10-31T08:17:59Z","title":"Why Do Multilingual Reasoning Gaps Emerge in Reasoning Language Models?","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T03:16:01.561180Z"},"links":{"cited_paper":"/paper/2503.10497","citing_paper":"/paper/2510.27269"},"observation_digest":"sha256:ea02873975c3c59357592a6a3d21a62e175d6ae8f0e40c0a3b5565118b6afe8e","observation_id":"0bf650b9-a6a6-4ba8-b0e1-e216529eed56","resolution":{"observed_at":"2026-05-18T03:20:49.205830Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10497","last_updated":"2025-05-26T17:20:21Z","snapshot_observed_at":"2026-08-07T17:06:40.468097Z","submitted_at":"2025-03-13T15:59:20Z","title":"MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation","version":2},"cited_work":{"arxiv_id":"2503.10497","doi":"10.48550/arxiv.2503.10497","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10497","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.10497 , year=","venue":"ArXiv.org","work_id":"932058b2-29f2-4aaf-b5b0-4cebd458e179","year":2023},"citing_paper":{"arxiv_id":"2604.06903","last_updated":"2026-04-08T09:59:50Z","snapshot_observed_at":"2026-08-02T16:01:52.905011Z","submitted_at":"2026-04-08T09:59:50Z","title":"Is Biomedical Specialization Still Worth It? Insights from Domain-Adaptive Language Modelling with a New French Health Corpus","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T18:29:09.281263Z"},"links":{"cited_paper":"/paper/2503.10497","citing_paper":"/paper/2604.06903"},"observation_digest":"sha256:bbe7ea54c18a4acccd1a484547954778113bd5dd1849089583a53bd916ddad99","observation_id":"bec86f7f-e4c7-42ae-b56a-a0c52930a7e2","resolution":{"observed_at":"2026-05-11T00:30:53.087429Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10497","last_updated":"2025-05-26T17:20:21Z","snapshot_observed_at":"2026-08-07T17:06:40.468097Z","submitted_at":"2025-03-13T15:59:20Z","title":"MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation","version":2},"cited_work":{"arxiv_id":"2503.10497","doi":"10.48550/arxiv.2503.10497","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10497","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.10497 , year=","venue":"ArXiv.org","work_id":"932058b2-29f2-4aaf-b5b0-4cebd458e179","year":2023},"citing_paper":{"arxiv_id":"2604.20720","last_updated":"2026-04-22T16:07:10Z","snapshot_observed_at":"2026-08-11T06:52:30.431907Z","submitted_at":"2026-04-22T16:07:10Z","title":"COMPASS: COntinual Multilingual PEFT with Adaptive Semantic Sampling","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-10T01:14:16.831333Z"},"links":{"cited_paper":"/paper/2503.10497","citing_paper":"/paper/2604.20720"},"observation_digest":"sha256:377e07159f4429e7e68d205964c5917e091f6c4dbdbb28c8c8e0675f6edf71b2","observation_id":"6239d49b-95bd-4115-bc44-72ccd4a0f39e","resolution":{"observed_at":"2026-05-11T13:41:05.547859Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10497","last_updated":"2025-05-26T17:20:21Z","snapshot_observed_at":"2026-08-07T17:06:40.468097Z","submitted_at":"2025-03-13T15:59:20Z","title":"MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation","version":2},"cited_work":{"arxiv_id":"2503.10497","doi":"10.48550/arxiv.2503.10497","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10497","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.10497 , year=","venue":"ArXiv.org","work_id":"932058b2-29f2-4aaf-b5b0-4cebd458e179","year":2023},"citing_paper":{"arxiv_id":"2605.14040","last_updated":"2026-05-13T19:00:57Z","snapshot_observed_at":"2026-07-06T23:25:29.856145Z","submitted_at":"2026-05-13T19:00:57Z","title":"Physics-R1: An Audited Olympiad Corpus and Recipe for Visual Physics Reasoning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-15T05:35:32.806871Z"},"links":{"cited_paper":"/paper/2503.10497","citing_paper":"/paper/2605.14040"},"observation_digest":"sha256:c0a49be1ae856f5c1eb0f94e6788cc4d05dc24a9688e767655b957c9e6bf9ee2","observation_id":"91014f22-4b00-4901-a80a-72d5e40d0df2","resolution":{"observed_at":"2026-05-15T05:39:47.780540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10497","last_updated":"2025-05-26T17:20:21Z","snapshot_observed_at":"2026-08-07T17:06:40.468097Z","submitted_at":"2025-03-13T15:59:20Z","title":"MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation","version":2},"cited_work":{"arxiv_id":"2503.10497","doi":"10.48550/arxiv.2503.10497","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10497","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.10497 , year=","venue":"ArXiv.org","work_id":"932058b2-29f2-4aaf-b5b0-4cebd458e179","year":2023},"citing_paper":{"arxiv_id":"2605.22567","last_updated":"2026-05-21T14:47:52Z","snapshot_observed_at":"2026-07-06T23:32:54.127514Z","submitted_at":"2026-05-21T14:47:52Z","title":"LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-22T06:19:44.377733Z"},"links":{"cited_paper":"/paper/2503.10497","citing_paper":"/paper/2605.22567"},"observation_digest":"sha256:c924d43a2283a205f7be359e7cc7705b82dd4fe91fcbfed5f789cd410819c189","observation_id":"c67d6216-ad29-4182-bc2c-ddc9650365db","resolution":{"observed_at":"2026-05-22T06:21:10.383716Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10497","last_updated":"2025-05-26T17:20:21Z","snapshot_observed_at":"2026-08-07T17:06:40.468097Z","submitted_at":"2025-03-13T15:59:20Z","title":"MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation","version":2},"cited_work":{"arxiv_id":"2503.10497","doi":"10.48550/arxiv.2503.10497","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10497","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.10497 , year=","venue":"ArXiv.org","work_id":"932058b2-29f2-4aaf-b5b0-4cebd458e179","year":2023},"citing_paper":{"arxiv_id":"2605.30107","last_updated":"2026-05-28T15:47:09Z","snapshot_observed_at":"2026-08-08T05:23:47.667022Z","submitted_at":"2026-05-28T15:47:09Z","title":"Dial HEALTHDIAL for Advice: A Multilingual and Multi-Parallel Spoken Dialogue Dataset for Knowledge-Grounded Information Seeking","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T07:55:17.832799Z"},"links":{"cited_paper":"/paper/2503.10497","citing_paper":"/paper/2605.30107"},"observation_digest":"sha256:db3c7a19bb8e120f6c67db4a6ff4551fd2734d0521987d5977cb72a8c855d1b4","observation_id":"80e1b972-e75d-400f-a470-081157ee5f03","resolution":{"observed_at":"2026-06-29T08:03:14.610430Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10497","last_updated":"2025-05-26T17:20:21Z","snapshot_observed_at":"2026-08-07T17:06:40.468097Z","submitted_at":"2025-03-13T15:59:20Z","title":"MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation","version":2},"cited_work":{"arxiv_id":"2503.10497","doi":"10.48550/arxiv.2503.10497","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10497","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.10497 , year=","venue":"ArXiv.org","work_id":"932058b2-29f2-4aaf-b5b0-4cebd458e179","year":2023},"citing_paper":{"arxiv_id":"2606.19640","last_updated":"2026-06-17T22:36:06Z","snapshot_observed_at":"2026-08-08T03:17:22.235627Z","submitted_at":"2026-06-17T22:36:06Z","title":"Creating Multilingual Mental Health Dialogue Datasets: Limits of Persona-Based Localization via Nationality and Language","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-26T20:27:41.561992Z"},"links":{"cited_paper":"/paper/2503.10497","citing_paper":"/paper/2606.19640"},"observation_digest":"sha256:401407848dfe7ce988fe686d362422cb52966e4d237e5c2bc6560421b99decd6","observation_id":"99c475e1-693c-43a0-9268-58784579774e","resolution":{"observed_at":"2026-06-26T20:29:57.595067Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10497","last_updated":"2025-05-26T17:20:21Z","snapshot_observed_at":"2026-08-07T17:06:40.468097Z","submitted_at":"2025-03-13T15:59:20Z","title":"MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10497","snapshot_observed_at":"2026-08-05T16:21:01.243283Z","title":"arXiv preprint arXiv:2503.10497 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03599","last_updated":"2026-08-04T12:51:21Z","snapshot_observed_at":"2026-08-10T16:30:32.056505Z","submitted_at":"2026-08-04T12:51:21Z","title":"Disentangling Language Modeling and Boundaries","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T16:21:01.243283Z"},"links":{"cited_paper":"/paper/2503.10497","citing_paper":"/paper/2608.03599"},"observation_digest":"sha256:81990f6d5a43dce9d528c4c5c1b9fddc509705f14125bf2cd45d86450f77b498","observation_id":"a5ab1097-0f80-4c81-9db2-e2c56a476596","resolution":{"observed_at":"2026-08-05T16:21:01.243283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2503.10497/citation-record","integrity":"/paper/2503.10497/integrity","json":"/paper/2503.10497/citation-record.json","paper":"/paper/2503.10497"},"outbound":[],"paper":{"arxiv_id":"2503.10497","last_updated":"2025-05-26T17:20:21Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T17:06:40.468097Z","submitted_at":"2025-03-13T15:59:20Z","title":"MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2503.10497."}