{"as_of":"2026-08-04T11:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c7a3fab56803fed8e1c24da2f84d9f99dc2cc8eb12c7db8349867c4408c272e5","coverage":[{"denominator":6,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T08:11:42.605933Z","state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T23:38:01.136296Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T10:38:12.628740Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.18026","last_updated":"2026-06-08T23:11:58Z","snapshot_observed_at":"2026-08-03T08:11:17.097557Z","submitted_at":"2026-01-25T22:49:30Z","title":"CommonLID: Re-evaluating State-of-the-Art Language Identification Performance on Web Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18026","snapshot_observed_at":"2026-08-02T23:38:01.136296Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.13139","last_updated":"2026-06-18T11:51:21Z","snapshot_observed_at":"2026-08-02T23:37:52.674187Z","submitted_at":"2026-02-13T17:47:08Z","title":"OpenLID-v3: Improving the Precision of Closely Related Language Identification -- An Experience Report","version":4},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-02T23:38:01.136296Z"},"links":{"cited_paper":"/paper/2601.18026","citing_paper":"/paper/2602.13139"},"observation_digest":"sha256:6b2faccd162bec873e3e3ab86ac133efd347532379a39bcb083392b16fc537bf","observation_id":"edcf3b4c-096b-4d99-a4d8-2c2ddba84ce6","resolution":{"observed_at":"2026-08-02T23:38:01.136296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18026","last_updated":"2026-06-08T23:11:58Z","snapshot_observed_at":"2026-08-03T08:11:17.097557Z","submitted_at":"2026-01-25T22:49:30Z","title":"CommonLID: Re-evaluating State-of-the-Art Language Identification Performance on Web Data","version":2},"cited_work":{"arxiv_id":"2601.18026","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.18026","snapshot_observed_at":"2026-06-10T02:10:33.790943Z","title":"CommonLID: Re-evaluating state-of-the-art language identification performance on web data","venue":null,"work_id":"692f02a9-a679-4f4b-a19e-e38173e880c7","year":2025},"citing_paper":{"arxiv_id":"2605.18232","last_updated":"2026-05-18T11:28:03Z","snapshot_observed_at":"2026-08-02T05:44:45.308802Z","submitted_at":"2026-05-18T11:28:03Z","title":"SomaliWeb v1: A Quality-Filtered Somali Web Corpus with a Matched Tokenizer and a Public Language-Identification Benchmark","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T10:34:49.783942Z"},"links":{"cited_paper":"/paper/2601.18026","citing_paper":"/paper/2605.18232"},"observation_digest":"sha256:cfeecd19cf2b05690830d0ad236260b80a797c6159c53bd2415d9858cd67cb6e","observation_id":"d09d5f5d-0ab5-4e41-971e-3679794e4a3a","resolution":{"observed_at":"2026-06-10T02:10:33.790943Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18026","last_updated":"2026-06-08T23:11:58Z","snapshot_observed_at":"2026-08-03T08:11:17.097557Z","submitted_at":"2026-01-25T22:49:30Z","title":"CommonLID: Re-evaluating State-of-the-Art Language Identification Performance on Web Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18026","snapshot_observed_at":"2026-08-02T04:42:20.637203Z","title":", Marivate, V., et al.: CommonLID: Re-evaluating state-of-the-art language iden tiﬁcation performance on web data","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13636","last_updated":"2026-07-15T09:29:24Z","snapshot_observed_at":"2026-08-03T06:31:59.856027Z","submitted_at":"2026-07-15T09:29:24Z","title":"Measuring What the Crawler Sees: Discovery Curves, Core Persistence, and Shell Dynamics in Longitudinal Web Crawls","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T04:42:20.637203Z"},"links":{"cited_paper":"/paper/2601.18026","citing_paper":"/paper/2607.13636"},"observation_digest":"sha256:011454339c3967ccfb5ed82de2e1a54b7c3e0efcf76b1ff6e624b5b703636e9b","observation_id":"703eea8f-5349-4b21-8045-ab5e46353985","resolution":{"observed_at":"2026-08-02T04:42:20.637203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2601.18026/citation-record","integrity":"/paper/2601.18026/integrity","json":"/paper/2601.18026/citation-record.json","paper":"/paper/2601.18026"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:11:42.597888Z","title":"InProceedings of the Tenth In- ternational Conference on Language Resources and Evaluation (LREC’16), pages 1659–1666, Portorož, Slovenia","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.18026","last_updated":"2026-06-08T23:11:58Z","snapshot_observed_at":"2026-08-03T08:11:17.097557Z","submitted_at":"2026-01-25T22:49:30Z","title":"CommonLID: Re-evaluating State-of-the-Art Language Identification Performance on Web Data","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T08:11:42.597888Z"},"links":{"citing_paper":"/paper/2601.18026"},"observation_digest":"sha256:72eaa17a8d62a73cd656e9e212b0cf124bb66e92c1b97045bb957eb4d2f3720a","observation_id":"82300291-75fa-4308-8e18-821f20c870a4","resolution":{"observed_at":"2026-08-03T08:11:42.597888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:11:42.601667Z","title":"Cardiff, 22nd July 2019, pages 9 – 16, Mannheim","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.18026","last_updated":"2026-06-08T23:11:58Z","snapshot_observed_at":"2026-08-03T08:11:17.097557Z","submitted_at":"2026-01-25T22:49:30Z","title":"CommonLID: Re-evaluating State-of-the-Art Language Identification Performance on Web Data","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T08:11:42.601667Z"},"links":{"citing_paper":"/paper/2601.18026"},"observation_digest":"sha256:5d47eabf8bf93fa6a77384c42bfc098c25a01b8aa60bf6383b9b7aa5387ab0d8","observation_id":"7708db4f-7f05-496e-a4d1-4ec9ef7c9a7c","resolution":{"observed_at":"2026-08-03T08:11:42.601667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03651","last_updated":"2016-12-12T12:51:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-12-12T12:51:03Z","title":"FastText.zip: Compressing text classification models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.03651","snapshot_observed_at":"2026-08-03T08:11:42.593576Z","title":"Armand Joulin, Edouard Grave, Piotr Bojanowski, and Tomas Mikolov","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.18026","last_updated":"2026-06-08T23:11:58Z","snapshot_observed_at":"2026-08-03T08:11:17.097557Z","submitted_at":"2026-01-25T22:49:30Z","title":"CommonLID: Re-evaluating State-of-the-Art Language Identification Performance on Web Data","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-03T08:11:42.593576Z"},"links":{"cited_paper":"/paper/1612.03651","citing_paper":"/paper/2601.18026"},"observation_digest":"sha256:14066d3f2561251c3dc494faa49ba3c05897520c610031efebfcd50b5d1c3b1e","observation_id":"b3acecd3-eb2e-4ee8-bce8-58daaf2a7c4b","resolution":{"observed_at":"2026-08-03T08:11:42.593576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-03T08:11:42.587187Z","title":"InProceedings of the 3rd Workshop on Noisy User-generated Text, pages 56–61, Copen- hagen, Denmark","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2601.18026","last_updated":"2026-06-08T23:11:58Z","snapshot_observed_at":"2026-08-03T08:11:17.097557Z","submitted_at":"2026-01-25T22:49:30Z","title":"CommonLID: Re-evaluating State-of-the-Art Language Identification Performance on Web Data","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T08:11:42.587187Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2601.18026"},"observation_digest":"sha256:34a15d1e6dabe4b398a525ae6f30e567c9c99fe4a2bef578e5e678582f831d73","observation_id":"0a46bdff-d9dd-4b68-8d3c-8e67f342d4e3","resolution":{"observed_at":"2026-08-03T08:11:42.587187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:11:42.605933Z","title":"publicly available datasets","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2601.18026","last_updated":"2026-06-08T23:11:58Z","snapshot_observed_at":"2026-08-03T08:11:17.097557Z","submitted_at":"2026-01-25T22:49:30Z","title":"CommonLID: Re-evaluating State-of-the-Art Language Identification Performance on Web Data","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T08:11:42.605933Z"},"links":{"citing_paper":"/paper/2601.18026"},"observation_digest":"sha256:afd82300a49bfbc24a8012f8b8410bd6762d0365d637448f0a3c214370c521cb","observation_id":"25e0aa6b-29e5-4649-b939-9b9f996c66f6","resolution":{"observed_at":"2026-08-03T08:11:42.605933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:11:29.806618Z","title":"InProceedings of the 24th Nordic Conference on Computational Linguistics (NoDaLiDa), pages 392–414, Tórshavn, Faroe Islands","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.18026","last_updated":"2026-06-08T23:11:58Z","snapshot_observed_at":"2026-08-03T08:11:17.097557Z","submitted_at":"2026-01-25T22:49:30Z","title":"CommonLID: Re-evaluating State-of-the-Art Language Identification Performance on Web Data","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T08:11:29.806618Z"},"links":{"citing_paper":"/paper/2601.18026"},"observation_digest":"sha256:715574ae5827acdcfdc66c107023af5aa8d632b9799be9dafaefafbfeae5c2bd","observation_id":"4a43f6d7-296a-44c7-b443-3d7f29812ce9","resolution":{"observed_at":"2026-08-03T08:11:29.806618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.18026","last_updated":"2026-06-08T23:11:58Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-03T08:11:17.097557Z","submitted_at":"2026-01-25T22:49:30Z","title":"CommonLID: Re-evaluating State-of-the-Art Language Identification Performance on Web Data"},"reference_resolution":{"displayed":6,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":6},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 6 of 6 outbound references and 3 inbound Pith citation observations for arXiv:2601.18026."}