{"as_of":"2026-08-18T14:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:41a03f8aa6e63caf5b4789379cd94d53dccb4e7c298cc186d4e660190e39eb30","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:44:49.143695Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.12058/citation-record","integrity":"/paper/2505.12058/integrity","json":"/paper/2505.12058/citation-record.json","paper":"/paper/2505.12058"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.12982","last_updated":"2024-11-25T14:32:25Z","snapshot_observed_at":"2026-08-18T08:01:49.548265Z","submitted_at":"2024-01-11T08:17:42Z","title":"A Comprehensive Survey of Text Classification Techniques and Their Research Applications: Observational and Experimental Insights","version":2},"cited_work":{"arxiv_id":"2401.12982","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.12982","snapshot_observed_at":"2026-08-15T20:44:49.316679Z","title":"A Comprehensive Survey of Text Classification Techniques and Their Research Applications: Observational and Experimental Insights","venue":"cs.CL","work_id":"73202ebe-3356-42b2-809c-403b2cab5d17","year":2024},"citing_paper":{"arxiv_id":"2505.12058","last_updated":"2025-05-17T15:40:03Z","snapshot_observed_at":"2026-08-16T15:14:20.560340Z","submitted_at":"2025-05-17T15:40:03Z","title":"Tiny QA Benchmark++: Ultra-Lightweight, Synthetic Multilingual Dataset Generation & Smoke-Tests for Continuous LLM Evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:49.090513Z"},"links":{"cited_paper":"/paper/2401.12982","citing_paper":"/paper/2505.12058"},"observation_digest":"sha256:0e874f809d094a40aa7db69f9d4b5886b2e46212052013298a2fc8b7207bd4c8","observation_id":"3ec16231-ed40-478d-a0a2-f7240c370cc4","resolution":{"observed_at":"2026-08-15T20:44:49.320389Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:49.103034Z","title":"Jaikanth J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12058","last_updated":"2025-05-17T15:40:03Z","snapshot_observed_at":"2026-08-16T15:14:20.560340Z","submitted_at":"2025-05-17T15:40:03Z","title":"Tiny QA Benchmark++: Ultra-Lightweight, Synthetic Multilingual Dataset Generation & Smoke-Tests for Continuous LLM Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:49.103034Z"},"links":{"citing_paper":"/paper/2505.12058"},"observation_digest":"sha256:7df5eafc8a4793b2d0ffc93f9f729a7199860d7b54a4dccb5c0723fae3c4f396","observation_id":"c70b4215-fad7-4e7f-bb3f-6c719db63b71","resolution":{"observed_at":"2026-08-15T20:44:49.103034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:49.349193Z","title":null,"venue":null,"work_id":"56ee5087-751b-4de5-9ea8-557c38c90183","year":2025},"citing_paper":{"arxiv_id":"2505.12058","last_updated":"2025-05-17T15:40:03Z","snapshot_observed_at":"2026-08-16T15:14:20.560340Z","submitted_at":"2025-05-17T15:40:03Z","title":"Tiny QA Benchmark++: Ultra-Lightweight, Synthetic Multilingual Dataset Generation & Smoke-Tests for Continuous LLM Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:49.106085Z"},"links":{"citing_paper":"/paper/2505.12058"},"observation_digest":"sha256:34a3acd1b8288d11d54ab9ac261ea42e2bf2e4a6b0f3ce3aa3596cb9b4c95eb7","observation_id":"6c8a1e29-fa53-45aa-abb2-22f6455cfa9e","resolution":{"observed_at":"2026-08-15T20:44:49.352402Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11496","last_updated":"2025-05-19T12:46:41Z","snapshot_observed_at":"2026-08-18T08:02:04.831978Z","submitted_at":"2025-01-20T14:03:40Z","title":"Generative AI and Large Language Models in Language Preservation: Opportunities and Challenges","version":2},"cited_work":{"arxiv_id":"2501.11496","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.11496","snapshot_observed_at":"2026-08-15T20:44:49.239486Z","title":"Generative AI and Large Language Models in Language Preservation: Opportunities and Challenges","venue":"cs.CL","work_id":"6c16da08-d48f-4ed3-a062-48154d53508b","year":2025},"citing_paper":{"arxiv_id":"2505.12058","last_updated":"2025-05-17T15:40:03Z","snapshot_observed_at":"2026-08-16T15:14:20.560340Z","submitted_at":"2025-05-17T15:40:03Z","title":"Tiny QA Benchmark++: Ultra-Lightweight, Synthetic Multilingual Dataset Generation & Smoke-Tests for Continuous LLM Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:49.109466Z"},"links":{"cited_paper":"/paper/2501.11496","citing_paper":"/paper/2505.12058"},"observation_digest":"sha256:3e4b8528a19251fed8576c3fd90013daef7ee3380472c3808d9aba1ec7f2fa8e","observation_id":"de949d48-5437-433d-81bc-bc3a912d0dae","resolution":{"observed_at":"2026-08-15T20:44:49.244691Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01684","last_updated":"2024-01-11T00:17:43Z","snapshot_observed_at":"2026-08-16T15:27:03.575086Z","submitted_at":"2023-06-02T16:59:36Z","title":"Harnessing large-language models to generate private synthetic text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01684","snapshot_observed_at":"2026-08-15T20:44:49.113008Z","title":"Lina Lam","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12058","last_updated":"2025-05-17T15:40:03Z","snapshot_observed_at":"2026-08-16T15:14:20.560340Z","submitted_at":"2025-05-17T15:40:03Z","title":"Tiny QA Benchmark++: Ultra-Lightweight, Synthetic Multilingual Dataset Generation & Smoke-Tests for Continuous LLM Evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:49.113008Z"},"links":{"cited_paper":"/paper/2306.01684","citing_paper":"/paper/2505.12058"},"observation_digest":"sha256:34a62476a4ad98e56786a4da0b4af9f423818565c865c05647098adfd81e416d","observation_id":"d2d73466-879d-4ae6-908b-cae8e3966e9f","resolution":{"observed_at":"2026-08-15T20:44:49.113008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:49.337757Z","title":"Vladimir I","venue":null,"work_id":"f3fea16b-5b5a-4c1e-a898-83a8edcb7c0d","year":2025},"citing_paper":{"arxiv_id":"2505.12058","last_updated":"2025-05-17T15:40:03Z","snapshot_observed_at":"2026-08-16T15:14:20.560340Z","submitted_at":"2025-05-17T15:40:03Z","title":"Tiny QA Benchmark++: Ultra-Lightweight, Synthetic Multilingual Dataset Generation & Smoke-Tests for Continuous LLM Evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:49.117448Z"},"links":{"citing_paper":"/paper/2505.12058"},"observation_digest":"sha256:1bb8fe8197200ec546a16456421abf41bc88c0279ace54108dea7d3ef2799145","observation_id":"cbc7993b-b2e9-4cc6-a779-eb973ccdb27a","resolution":{"observed_at":"2026-08-15T20:44:49.341057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-18T08:00:35.964338Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-15T20:44:49.128978Z","title":"Pratyush Maini, Mohammad Yaghini, and Nicolas Papernot","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12058","last_updated":"2025-05-17T15:40:03Z","snapshot_observed_at":"2026-08-16T15:14:20.560340Z","submitted_at":"2025-05-17T15:40:03Z","title":"Tiny QA Benchmark++: Ultra-Lightweight, Synthetic Multilingual Dataset Generation & Smoke-Tests for Continuous LLM Evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:49.128978Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2505.12058"},"observation_digest":"sha256:2f57a28bdeac94667329c6e29e937b319a4c1b9920f8cead8ce21b5c7d52a0af","observation_id":"7befa1f8-c309-40ba-9a43-c5188c9435d8","resolution":{"observed_at":"2026-08-15T20:44:49.128978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10706","last_updated":"2021-04-21T18:12:18Z","snapshot_observed_at":"2026-08-16T18:29:55.068380Z","submitted_at":"2021-04-21T18:12:18Z","title":"Dataset Inference: Ownership Resolution in Machine Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10706","snapshot_observed_at":"2026-08-15T20:44:49.132230Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12058","last_updated":"2025-05-17T15:40:03Z","snapshot_observed_at":"2026-08-16T15:14:20.560340Z","submitted_at":"2025-05-17T15:40:03Z","title":"Tiny QA Benchmark++: Ultra-Lightweight, Synthetic Multilingual Dataset Generation & Smoke-Tests for Continuous LLM Evaluation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:49.132230Z"},"links":{"cited_paper":"/paper/2104.10706","citing_paper":"/paper/2505.12058"},"observation_digest":"sha256:34d386887363ce0848a60f2f215a7d8b877405c80282d3e32099da6331d6806c","observation_id":"d40aa916-bdc1-4071-838d-1464500e4dee","resolution":{"observed_at":"2026-08-15T20:44:49.132230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:49.327447Z","title":"Felipe Maia Polo, Lucas Weber, Leshem Choshen, Yuekai Sun, Gongjun Xu, and Mikhail Yurochkin","venue":null,"work_id":"0099641f-21b0-4125-8187-1628f63793b7","year":2025},"citing_paper":{"arxiv_id":"2505.12058","last_updated":"2025-05-17T15:40:03Z","snapshot_observed_at":"2026-08-16T15:14:20.560340Z","submitted_at":"2025-05-17T15:40:03Z","title":"Tiny QA Benchmark++: Ultra-Lightweight, Synthetic Multilingual Dataset Generation & Smoke-Tests for Continuous LLM Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:49.135686Z"},"links":{"citing_paper":"/paper/2505.12058"},"observation_digest":"sha256:8094d0d9922fe084ceda06a52dfbc8851effd6f82440b8e71cad01e8b324b1c8","observation_id":"9f93db07-3bcc-4c17-a883-30816218d60c","resolution":{"observed_at":"2026-08-15T20:44:49.330745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14992","last_updated":"2024-05-26T22:27:23Z","snapshot_observed_at":"2026-08-17T02:59:38.954198Z","submitted_at":"2024-02-22T22:05:23Z","title":"tinyBenchmarks: evaluating LLMs with fewer examples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14992","snapshot_observed_at":"2026-08-15T20:44:49.139785Z","title":"Aarohi Srivastava et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12058","last_updated":"2025-05-17T15:40:03Z","snapshot_observed_at":"2026-08-16T15:14:20.560340Z","submitted_at":"2025-05-17T15:40:03Z","title":"Tiny QA Benchmark++: Ultra-Lightweight, Synthetic Multilingual Dataset Generation & Smoke-Tests for Continuous LLM Evaluation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:49.139785Z"},"links":{"cited_paper":"/paper/2402.14992","citing_paper":"/paper/2505.12058"},"observation_digest":"sha256:dafc1736064e1bd63c8a7b911d20508f61cf4d63065ca97a380852d5e490b370","observation_id":"77c98e17-d408-4441-84e7-13f7fcd1f49a","resolution":{"observed_at":"2026-08-15T20:44:49.139785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-15T20:44:49.143695Z","title":"Yuchen Zhuang, Yue Yu, Kuan Wang, Haotian Sun, and Chao Zhang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12058","last_updated":"2025-05-17T15:40:03Z","snapshot_observed_at":"2026-08-16T15:14:20.560340Z","submitted_at":"2025-05-17T15:40:03Z","title":"Tiny QA Benchmark++: Ultra-Lightweight, Synthetic Multilingual Dataset Generation & Smoke-Tests for Continuous LLM Evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:49.143695Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2505.12058"},"observation_digest":"sha256:965ac93160e4dce095f849ebc8cf88342a8bc31b8ce84ed4a6c67ea147c0e187","observation_id":"235e33c2-bda0-4b2d-a0b9-c767fbf4d179","resolution":{"observed_at":"2026-08-15T20:44:49.143695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-15T20:44:49.120283Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12058","last_updated":"2025-05-17T15:40:03Z","snapshot_observed_at":"2026-08-16T15:14:20.560340Z","submitted_at":"2025-05-17T15:40:03Z","title":"Tiny QA Benchmark++: Ultra-Lightweight, Synthetic Multilingual Dataset Generation & Smoke-Tests for Continuous LLM Evaluation","version":1},"reference_index":1966,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:49.120283Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2505.12058"},"observation_digest":"sha256:47b5047ba0e457fd1cdae88528c72c5a363581e8b4221b7b74956a27faff23ea","observation_id":"166db7f0-7f4d-4bf6-bdc2-f6e8ebf26969","resolution":{"observed_at":"2026-08-15T20:44:49.120283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-15T20:44:49.100163Z","title":"Andreas Hochlehnert, Hardik Bhatnagar, Vishaal Udandarao, Samuel Albanie, Ameya Prabhu, and Matthias Bethge","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.12058","last_updated":"2025-05-17T15:40:03Z","snapshot_observed_at":"2026-08-16T15:14:20.560340Z","submitted_at":"2025-05-17T15:40:03Z","title":"Tiny QA Benchmark++: Ultra-Lightweight, Synthetic Multilingual Dataset Generation & Smoke-Tests for Continuous LLM Evaluation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:49.100163Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.12058"},"observation_digest":"sha256:d9ef4ffcbc5db94ac4a7a452fbc76e55e212afc9f8f822fb42d989e0455e2b6d","observation_id":"e6485176-c99e-4289-9f32-f0cd467d1647","resolution":{"observed_at":"2026-08-15T20:44:49.100163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-16T00:51:32.846970Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-15T20:44:49.123971Z","title":"Lin Long, Rui Wang, Ruixuan Xiao, Junbo Zhao, Xiao Ding, Gang Chen, and Haobo Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12058","last_updated":"2025-05-17T15:40:03Z","snapshot_observed_at":"2026-08-16T15:14:20.560340Z","submitted_at":"2025-05-17T15:40:03Z","title":"Tiny QA Benchmark++: Ultra-Lightweight, Synthetic Multilingual Dataset Generation & Smoke-Tests for Continuous LLM Evaluation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:49.123971Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2505.12058"},"observation_digest":"sha256:7aa3ade3f51cfa6b71505e2fcfed2b4a203f613d1e99e07eab6eb0b8c0783a07","observation_id":"97ef3422-0d34-4338-86fd-75cbb5ef5f1f","resolution":{"observed_at":"2026-08-15T20:44:49.123971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:44:49.360007Z","title":null,"venue":null,"work_id":"bdc12ba7-3bdd-42e8-9239-da86c47bf5a3","year":2025},"citing_paper":{"arxiv_id":"2505.12058","last_updated":"2025-05-17T15:40:03Z","snapshot_observed_at":"2026-08-16T15:14:20.560340Z","submitted_at":"2025-05-17T15:40:03Z","title":"Tiny QA Benchmark++: Ultra-Lightweight, Synthetic Multilingual Dataset Generation & Smoke-Tests for Continuous LLM Evaluation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:49.094201Z"},"links":{"citing_paper":"/paper/2505.12058"},"observation_digest":"sha256:0db5968ca211d310b8a2d9af68f6baa4950bca0aff53892090588e0d1c288708","observation_id":"01174b6c-276e-48be-a948-70db6bfb2556","resolution":{"observed_at":"2026-08-15T20:44:49.363461Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.12058","last_updated":"2025-05-17T15:40:03Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T15:14:20.560340Z","submitted_at":"2025-05-17T15:40:03Z","title":"Tiny QA Benchmark++: Ultra-Lightweight, Synthetic Multilingual Dataset Generation & Smoke-Tests for Continuous LLM Evaluation"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 0 inbound Pith citation observations for arXiv:2505.12058."}