{"as_of":"2026-08-09T00:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a9ad3194ccdfae15678aa02c664ca005ac597d92c830e0c8cbdcf1273b01547f","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T13:58:58.597059Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T20:53:57.646472Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T00:49:19.438760Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-08T23:44:34.441175Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"cited_work":{"arxiv_id":"2502.07057","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07057","snapshot_observed_at":"2026-07-04T00:49:19.438760Z","title":"Ali Bayram, Ali Arda Fincan, Ahmet Semih G \\\"u m \\\"u s , Sercan Karaka s , Banu Diri, and Sava s Y ld r m","venue":null,"work_id":"a4ded22f-a474-4a52-bac4-ca17254eddba","year":null},"citing_paper":{"arxiv_id":"2606.18717","last_updated":"2026-06-17T05:55:50Z","snapshot_observed_at":"2026-08-08T02:34:27.463524Z","submitted_at":"2026-06-17T05:55:50Z","title":"Morpheus: A Morphology-Aware Neural Tokenizer and Word Embedder for Turkish","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-26T20:53:57.646472Z"},"links":{"cited_paper":"/paper/2502.07057","citing_paper":"/paper/2606.18717"},"observation_digest":"sha256:dadca119b2bfb1b80c2169c7340ff886379651ea086a00eb52cea91285b8470c","observation_id":"9c59362a-d240-4fc7-96b8-55705f8931c1","resolution":{"observed_at":"2026-07-04T00:49:19.441232Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.07057/citation-record","integrity":"/paper/2502.07057/integrity","json":"/paper/2502.07057/citation-record.json","paper":"/paper/2502.07057"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.888343Z","title":"Tokenization Is More Than Compression","venue":null,"work_id":"e7ead1b0-4e23-43eb-9714-34b41642e171","year":2024},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-08T23:44:34.441175Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.514018Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:4a6a8866e7a837f63e5a0db3bdf08936b2428c7f8be6769230f0ef32cad901a6","observation_id":"e8435d93-5282-4c6e-976b-0d38f7f10bbc","resolution":{"observed_at":"2026-08-08T13:58:58.892514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.876977Z","title":null,"venue":null,"work_id":"a03a50f7-3c96-402e-adfc-5167bfea8a8f","year":2019},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-08T23:44:34.441175Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.518772Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:f8c19b9f1a4bfbaaf316fff1e5b178a1e4ddb9e4e0863cb8b646318c95214a95","observation_id":"d374156d-3e5b-47e0-86a6-10cce3c7338e","resolution":{"observed_at":"2026-08-08T13:58:58.881244Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.865034Z","title":"How do different tokenizers perform on downstream tasks in scriptio continua languages?: A case study in japanese","venue":null,"work_id":"e9daa43f-f867-4b1d-8c7a-87c85b0cf273","year":2023},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-08T23:44:34.441175Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.522901Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:d3d6b2d8c3f8b8f44eb3a0b71968f9790ba85f447a25f7f20121245c60e80c07","observation_id":"ddbab64a-6d8f-43eb-bb42-51dfb39d4943","resolution":{"observed_at":"2026-08-08T13:58:58.869782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.853862Z","title":"Critical tokenization and its properties","venue":null,"work_id":"c25c83dd-4e53-4d86-a960-3c4648e0f809","year":1997},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-08T23:44:34.441175Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.526306Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:1d6191a2923efcf137c98bdb0587c501af9fa1fd5d260ba52a4c348368538cfa","observation_id":"4da0aa48-8e4f-490b-9630-431a09e54865","resolution":{"observed_at":"2026-08-08T13:58:58.857711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06226","last_updated":"2018-08-19T16:49:06Z","snapshot_observed_at":"2026-07-06T06:56:20.935388Z","submitted_at":"2018-08-19T16:49:06Z","title":"SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.06226","snapshot_observed_at":"2026-08-08T13:58:58.530907Z","title":"SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing, August 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-08T23:44:34.441175Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.530907Z"},"links":{"cited_paper":"/paper/1808.06226","citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:b93bc3119040a7613d410ec973b1ca28f46ba3e85f5ea3123749c41bb60b1dbd","observation_id":"5f10b29d-b30a-42b0-bc2f-ae8cdf34b639","resolution":{"observed_at":"2026-08-08T13:58:58.530907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12345","last_updated":"2023-01-29T03:59:33Z","snapshot_observed_at":"2026-08-04T10:52:46.997548Z","submitted_at":"2023-01-29T03:59:33Z","title":"Chemotactic motility-induced phase separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12345","snapshot_observed_at":"2026-08-08T13:58:58.535300Z","title":"Formal properties of tokenization in neural language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-08T23:44:34.441175Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.535300Z"},"links":{"cited_paper":"/paper/2301.12345","citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:5add5ffc8f24006fc78cb5a1aefb681b5651be312ff2bdf295d30df8fc75f2ec","observation_id":"5926943e-bc6e-4ab8-afe4-06ef4863c5d4","resolution":{"observed_at":"2026-08-08T13:58:58.535300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08715","last_updated":"2023-09-15T19:10:42Z","snapshot_observed_at":"2026-07-06T16:19:13.935627Z","submitted_at":"2023-09-15T19:10:42Z","title":"Formalizing BPE Tokenization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08715","snapshot_observed_at":"2026-08-08T13:58:58.539958Z","title":"Formalizing BPE Tokenization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-08T23:44:34.441175Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.539958Z"},"links":{"cited_paper":"/paper/2309.08715","citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:7e04f438f02a5cd4f66777e087db5496c7ec1e46b301f26e37cef0f44deb7137","observation_id":"2f903b61-5838-4090-a979-bd945a6b9c11","resolution":{"observed_at":"2026-08-08T13:58:58.539958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.841882Z","title":"The Technical User’s Introduction to LLM Tokenization","venue":null,"work_id":"f620ff8b-8a26-4f7f-8b9e-318bdc0fc594","year":null},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-08T23:44:34.441175Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.544214Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:481ed8767aea6af89da2486762f2eab3bbce50e2131d1f5cae384b862c5dc374","observation_id":"af1abc08-fbc1-4fbf-aa29-71647036cd41","resolution":{"observed_at":"2026-08-08T13:58:58.846367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.830631Z","title":"A New Algorithm for Data Compression, 1994","venue":null,"work_id":"bad30c38-9c61-4642-90c2-c85e22a154f3","year":1994},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-08T23:44:34.441175Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.548336Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:5273d2af704cad33e6a664f8a76e901c34c4e5ccb174338a1e3d25080f0295e1","observation_id":"3335b46e-21c7-45a8-9e96-c7d68c67edff","resolution":{"observed_at":"2026-08-08T13:58:58.834784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.818292Z","title":"github.com/riotu-lab/aranizer, December 2024","venue":null,"work_id":"aa6a1b10-04b0-4613-8c5a-ce812b8fe19a","year":2024},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-08T23:44:34.441175Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.551338Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:961026c050988306309cfaa802bbdc77403530cc3cc9bd043af7096cfaf963d3","observation_id":"4a6da132-4bf4-4a48-881b-c155a60e938c","resolution":{"observed_at":"2026-08-08T13:58:58.822901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.806396Z","title":"So many tokens, so little time: Introducing a faster, more flexible byte-pair tokenizer, December 2024","venue":null,"work_id":"747b6076-810d-4017-ad41-f73417516267","year":2024},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-08T23:44:34.441175Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.554589Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:dc5b45726fd995f33071535012f10d57c63e2674f8bc717c498cd6f19d7d6ca0","observation_id":"06daf0fe-fe4f-4285-82de-016854153ab7","resolution":{"observed_at":"2026-08-08T13:58:58.810188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.789831Z","title":"Arabic Tokenizers Leaderboard - a Hugging Face Space by MohamedRashad","venue":null,"work_id":"1c5afc08-846b-4c09-af85-ff5b750bcf8a","year":null},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-08T23:44:34.441175Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.558056Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:78b7b459ef031fe615c43053356d58385c9530706aa695a9c30d616457a5afd7","observation_id":"1e9a9452-5499-4bf5-905d-83e47c234d98","resolution":{"observed_at":"2026-08-08T13:58:58.793754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.776940Z","title":"NbAiLab/tokenizer-benchmark, November 2024","venue":null,"work_id":"c06115ea-cacd-483a-9eab-cedbe7b71b6f","year":2024},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-08T23:44:34.441175Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.561881Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:4ddf039ddc2800d7288de457300e427f820720baa0901804acb1316f6f327dbd","observation_id":"fb2149e2-4a93-417c-994c-ca0684d2ef07","resolution":{"observed_at":"2026-08-08T13:58:58.782283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.763683Z","title":"Tokenizing on scale.Preprocessing large text corpora on the lexical and sentence level","venue":null,"work_id":"ce9ebe10-b386-49ba-a714-6c65d03b7023","year":2022},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-08T23:44:34.441175Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.565542Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:71885d54b547cf231854ac1a02884a36960c35e32528e2d7a024e55c3a4f5c9a","observation_id":"099c238d-30de-48db-8698-9fb6448049b4","resolution":{"observed_at":"2026-08-08T13:58:58.768447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.750791Z","title":"Analysis of Subword Tokenization Approaches for Turkish Language","venue":null,"work_id":"e646a24c-5c07-4c4e-aa62-14be70f08e8e","year":2023},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-08T23:44:34.441175Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.568407Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:7b0d0b8dcc156e0485e77e5d61a2f3625555b5581d3e7db1207163057c748500","observation_id":"128c76ba-c58e-4c16-bb51-c43d74aab12c","resolution":{"observed_at":"2026-08-08T13:58:58.754936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16235","last_updated":"2024-09-24T16:51:36Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T16:51:36Z","title":"EuroLLM: Multilingual Language Models for Europe","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16235","snapshot_observed_at":"2026-08-08T13:58:58.571329Z","title":"Guerreiro, Ricardo Rei, Duarte M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-08T23:44:34.441175Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.571329Z"},"links":{"cited_paper":"/paper/2409.16235","citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:64e36a17dc1461f400bcea1a0d5db7d8df66c440326d388e632ba7e83944b6d6","observation_id":"89aab7e3-7877-4b3d-9daf-13b67e6a345f","resolution":{"observed_at":"2026-08-08T13:58:58.571329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.738180Z","title":"How Good is Your Tokenizer? On the Monolingual Performance of Multilingual Language Models, June","venue":null,"work_id":"435c22cc-8366-42d3-bf5f-0813ec134d5e","year":null},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-08T23:44:34.441175Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.575667Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:603dc05e4366690bae28a29506880a695c6b0d435cba5148470c01e080198072","observation_id":"2a8a8885-e358-415a-b3dd-2f010c29951e","resolution":{"observed_at":"2026-08-08T13:58:58.742478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.726392Z","title":"Not All Tokens Are What You Need for Pretraining","venue":null,"work_id":"8b4c0934-e5ea-4fdb-9575-47456548a930","year":null},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-08T23:44:34.441175Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.583279Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:0f78632e30bcc70a68fe149617c3a6c05eb4ecc1fa94f0311bd0afc7358b0d21","observation_id":"da76be89-48bc-459d-93d1-f78fcf1932b6","resolution":{"observed_at":"2026-08-08T13:58:58.730830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00593","last_updated":"2025-01-04T20:42:33Z","snapshot_observed_at":"2026-07-06T20:15:17.786867Z","submitted_at":"2024-12-31T18:43:49Z","title":"Setting Standards in Turkish NLP: TR-MMLU for Large Language Model Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00593","snapshot_observed_at":"2026-08-08T13:58:58.586474Z","title":"Ali Bayram, Ali Arda Fincan, Ahmet Semih Gümü¸ s, Banu Diri, Sava¸ s Yıldırım, and Öner Ayta¸ s","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-08T23:44:34.441175Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.586474Z"},"links":{"cited_paper":"/paper/2501.00593","citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:6a273a577ab18df314fc4f3c7f135e605070f3b5503eb255f65d6e8992141f28","observation_id":"2cfa602c-f3d2-4591-929f-7b3963a6b6ef","resolution":{"observed_at":"2026-08-08T13:58:58.586474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.714273Z","title":"ITU Turkish NLP Web Service","venue":null,"work_id":"43c02d3b-c97b-41bf-9955-1a5ae9d751e9","year":2014},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-08T23:44:34.441175Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.590224Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:d16f6554979fd4d0eb0161239ed88b64efeaa80774ec90963235800aa1b509ca","observation_id":"a9daa4db-dbf0-47ca-b0c4-818c15cd2366","resolution":{"observed_at":"2026-08-08T13:58:58.718416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.702028Z","title":"ahmetax/kalbur, October 2024","venue":null,"work_id":"6473d38d-9722-4ada-a345-2c4f906a3691","year":2024},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-08T23:44:34.441175Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.593375Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:28ec0384b0579c9f9bd85decd76e0505550b96efab952369693b8f2d1122f699","observation_id":"617aa5f9-e6b1-4558-b0ff-741e6ce74e0b","resolution":{"observed_at":"2026-08-08T13:58:58.706260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:58:58.689652Z","title":"Ali Bayram","venue":null,"work_id":"e474d0c7-4b48-49ff-a025-b90e382342e5","year":2024},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-08T23:44:34.441175Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.597059Z"},"links":{"citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:46aa8aae94f98459f5772dee1b7cf5c343dcb39f887b47ff995aaa4767084367","observation_id":"10db0fcf-e5b1-4566-a060-6c33370a1828","resolution":{"observed_at":"2026-08-08T13:58:58.694284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.15613","last_updated":"2021-06-01T18:17:59Z","snapshot_observed_at":"2026-07-06T10:29:01.682011Z","submitted_at":"2020-12-31T14:11:00Z","title":"How Good is Your Tokenizer? On the Monolingual Performance of Multilingual Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.15613","snapshot_observed_at":"2026-08-08T13:58:58.579433Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","snapshot_observed_at":"2026-08-08T23:44:34.441175Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T13:58:58.579433Z"},"links":{"cited_paper":"/paper/2012.15613","citing_paper":"/paper/2502.07057"},"observation_digest":"sha256:b65c1bc755268de62ac3f1021f6e8f477e4d741903246a699d227f5e4c69415f","observation_id":"87669eec-12e7-4ce2-b555-855d4fbc350a","resolution":{"observed_at":"2026-08-08T13:58:58.579433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.07057","last_updated":"2025-07-21T14:05:14Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T23:44:34.441175Z","submitted_at":"2025-02-10T21:47:49Z","title":"Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 1 inbound Pith citation observation for arXiv:2502.07057."}