{"as_of":"2026-08-09T18:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ceff4c910a86c7ede877d52fcaf000afebe792d0b0b9ed63f11f1e9de7137c90","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T13:23:55.114628Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.24667/citation-record","integrity":"/paper/2605.24667/integrity","json":"/paper/2605.24667/citation-record.json","paper":"/paper/2605.24667"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.20816","last_updated":"2026-05-08T01:10:04Z","snapshot_observed_at":"2026-07-06T22:46:53.725781Z","submitted_at":"2026-02-24T11:54:06Z","title":"Don't Ignore the Tail: Decoupling top-K Probabilities for Efficient Language Model Distillation","version":3},"cited_work":{"arxiv_id":"2602.20816","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.20816","snapshot_observed_at":"2026-06-30T13:24:39.965787Z","title":"Don't Ignore the Tail: Decoupling top-K Probabilities for Efficient Language Model Distillation","venue":"cs.CL","work_id":"43fb9d24-d1a4-413c-8846-cf234cf9bb8a","year":2026},"citing_paper":{"arxiv_id":"2605.24667","last_updated":"2026-05-23T17:10:20Z","snapshot_observed_at":"2026-08-01T07:37:33.980490Z","submitted_at":"2026-05-23T17:10:20Z","title":"When Mean CE Fails: Median CE Can Better Track Language Model Quality","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T13:23:55.114628Z"},"links":{"cited_paper":"/paper/2602.20816","citing_paper":"/paper/2605.24667"},"observation_digest":"sha256:f9abdbb830b1bf202d3f08f7f070cb293cccba7b8d9a95dfec4a1aa554b6de81","observation_id":"5dd350d3-ded2-45d1-9f8b-f0ff8599591e","resolution":{"observed_at":"2026-06-30T13:24:39.967032Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07759","last_updated":"2023-05-24T23:30:43Z","snapshot_observed_at":"2026-08-04T10:35:00.917001Z","submitted_at":"2023-05-12T20:56:48Z","title":"TinyStories: How Small Can Language Models Be and Still Speak Coherent English?","version":2},"cited_work":{"arxiv_id":"2305.07759","doi":"10.48550/arxiv.2305.07759","metadata_source":"pith","pith_arxiv_id":"2305.07759","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"TinyStories: How Small Can Language Models Be and Still Speak Coherent English?","venue":"cs.CL","work_id":"cec035ae-bbf2-429c-86c6-6de8fefaf43d","year":2023},"citing_paper":{"arxiv_id":"2605.24667","last_updated":"2026-05-23T17:10:20Z","snapshot_observed_at":"2026-08-01T07:37:33.980490Z","submitted_at":"2026-05-23T17:10:20Z","title":"When Mean CE Fails: Median CE Can Better Track Language Model Quality","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T13:23:55.114628Z"},"links":{"cited_paper":"/paper/2305.07759","citing_paper":"/paper/2605.24667"},"observation_digest":"sha256:9916cae1f72b860c532f5b7fb1b534b7a242288f326f72b186eaf7c249726198","observation_id":"08efea3f-7c10-49d2-b791-c5b0130c9f66","resolution":{"observed_at":"2026-06-30T13:24:39.950539Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-08-02T20:03:32.798288Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"cited_work":{"arxiv_id":"2306.08543","doi":"10.48550/arxiv.2306.08543","metadata_source":"pith","pith_arxiv_id":"2306.08543","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","venue":"cs.CL","work_id":"16edb291-dd18-41c5-8486-c6c715ec5311","year":2023},"citing_paper":{"arxiv_id":"2605.24667","last_updated":"2026-05-23T17:10:20Z","snapshot_observed_at":"2026-08-01T07:37:33.980490Z","submitted_at":"2026-05-23T17:10:20Z","title":"When Mean CE Fails: Median CE Can Better Track Language Model Quality","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T13:23:55.114628Z"},"links":{"cited_paper":"/paper/2306.08543","citing_paper":"/paper/2605.24667"},"observation_digest":"sha256:1f472d4fcd1c6fa787f74641ca51e0aeedf66f7debd76bd93f579bad83caa849","observation_id":"8d46e23f-9dff-4889-bf50-fb293cab2fbd","resolution":{"observed_at":"2026-06-30T13:24:39.971420Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":"1503.02531","doi":"10.1109/cvpr52733.2024.01515","metadata_source":"pith","pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distilling the Knowledge in a Neural Network","venue":"stat.ML","work_id":"d927ab1f-17b8-4002-9d09-c3d55764fbad","year":2015},"citing_paper":{"arxiv_id":"2605.24667","last_updated":"2026-05-23T17:10:20Z","snapshot_observed_at":"2026-08-01T07:37:33.980490Z","submitted_at":"2026-05-23T17:10:20Z","title":"When Mean CE Fails: Median CE Can Better Track Language Model Quality","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T13:23:55.114628Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2605.24667"},"observation_digest":"sha256:cd4c1047dc6170b76ece48d1a1f7f2857985bd7f20486602a8c0cd3993abc753","observation_id":"4ddf8e2c-bd92-43df-8662-8385a14a450e","resolution":{"observed_at":"2026-06-30T13:24:39.953012Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.10351","last_updated":"2020-10-16T02:12:46Z","snapshot_observed_at":"2026-08-07T22:21:53.513424Z","submitted_at":"2019-09-23T13:05:35Z","title":"TinyBERT: Distilling BERT for Natural Language Understanding","version":5},"cited_work":{"arxiv_id":"1909.10351","doi":"10.48550/arxiv.1909.10351","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.10351","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tinybert: Distilling bert for natural language understanding","venue":"arXiv (Cornell University)","work_id":"40d9fbb8-3c66-44bf-955c-5b5560f1e2f8","year":1909},"citing_paper":{"arxiv_id":"2605.24667","last_updated":"2026-05-23T17:10:20Z","snapshot_observed_at":"2026-08-01T07:37:33.980490Z","submitted_at":"2026-05-23T17:10:20Z","title":"When Mean CE Fails: Median CE Can Better Track Language Model Quality","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T13:23:55.114628Z"},"links":{"cited_paper":"/paper/1909.10351","citing_paper":"/paper/2605.24667"},"observation_digest":"sha256:12907a37990398bafd08fac20584b611f685dd2d2bdaeb5e9fe52fdacf684cfa","observation_id":"4582d3fa-d37a-48e4-8a69-d02152f30f1f","resolution":{"observed_at":"2026-06-30T13:24:39.948088Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":"2406.17557","doi":"10.48550/arxiv.2406.17557","metadata_source":"pith","pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","venue":"cs.CL","work_id":"1ac90585-1330-4f90-8836-6382fa63c4eb","year":2024},"citing_paper":{"arxiv_id":"2605.24667","last_updated":"2026-05-23T17:10:20Z","snapshot_observed_at":"2026-08-01T07:37:33.980490Z","submitted_at":"2026-05-23T17:10:20Z","title":"When Mean CE Fails: Median CE Can Better Track Language Model Quality","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T13:23:55.114628Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2605.24667"},"observation_digest":"sha256:5827878c249b065016beb0f6e87865d1ced3523210ae4f52afd23df67ea92f58","observation_id":"dcff0ee8-55f5-490f-b00c-e509c786d58b","resolution":{"observed_at":"2026-06-30T13:24:39.966451Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10938","last_updated":"2024-10-01T23:38:10Z","snapshot_observed_at":"2026-07-06T18:15:54.402568Z","submitted_at":"2024-05-17T17:49:44Z","title":"Observational Scaling Laws and the Predictability of Language Model Performance","version":3},"cited_work":{"arxiv_id":"2405.10938","doi":"10.48550/arxiv.2405.10938","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.10938","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Observational scaling laws and the predictability of language model performance.arXiv preprint arXiv:2405.10938","venue":"arXiv (Cornell University)","work_id":"e584b9ea-2c55-4358-b53d-c8f3a6b3422d","year":2024},"citing_paper":{"arxiv_id":"2605.24667","last_updated":"2026-05-23T17:10:20Z","snapshot_observed_at":"2026-08-01T07:37:33.980490Z","submitted_at":"2026-05-23T17:10:20Z","title":"When Mean CE Fails: Median CE Can Better Track Language Model Quality","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T13:23:55.114628Z"},"links":{"cited_paper":"/paper/2405.10938","citing_paper":"/paper/2605.24667"},"observation_digest":"sha256:00aae08fba68a43fbd3aa25a0e57dca81593c28b09f774c6987a757f684c77b8","observation_id":"d72e7980-5f28-434e-b71f-1ae3d651c4f3","resolution":{"observed_at":"2026-06-30T13:24:39.964653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":"1910.01108","doi":"10.48550/arxiv.1910.01108","metadata_source":"pith","pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-07-11T02:57:46.620845Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","venue":"cs.CL","work_id":"756f9764-ecd6-4672-8043-b37c698c7ad2","year":2019},"citing_paper":{"arxiv_id":"2605.24667","last_updated":"2026-05-23T17:10:20Z","snapshot_observed_at":"2026-08-01T07:37:33.980490Z","submitted_at":"2026-05-23T17:10:20Z","title":"When Mean CE Fails: Median CE Can Better Track Language Model Quality","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T13:23:55.114628Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2605.24667"},"observation_digest":"sha256:f2d56173536381299d7ad55b88d89d8b0b555401ef30819142ce465393a8a570","observation_id":"5f617ea4-428a-4893-875e-c6a49a081e6f","resolution":{"observed_at":"2026-06-30T13:24:39.961897Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":"2307.08621","doi":"10.48550/arxiv.2307.08621","metadata_source":"pith","pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","venue":"cs.CL","work_id":"5b0449ac-92b0-41f2-8b4f-586c2b5a08b6","year":2023},"citing_paper":{"arxiv_id":"2605.24667","last_updated":"2026-05-23T17:10:20Z","snapshot_observed_at":"2026-08-01T07:37:33.980490Z","submitted_at":"2026-05-23T17:10:20Z","title":"When Mean CE Fails: Median CE Can Better Track Language Model Quality","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T13:23:55.114628Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2605.24667"},"observation_digest":"sha256:9cb6cec56bb862dc3edc2cf299a8a1c0d96f0b83bb6dd7b9131cabb182207262","observation_id":"b5427515-d49a-42e9-980f-3f2799e3eb94","resolution":{"observed_at":"2026-06-30T13:24:39.969088Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2605.24667","last_updated":"2026-05-23T17:10:20Z","snapshot_observed_at":"2026-08-01T07:37:33.980490Z","submitted_at":"2026-05-23T17:10:20Z","title":"When Mean CE Fails: Median CE Can Better Track Language Model Quality","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T13:23:55.114628Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2605.24667"},"observation_digest":"sha256:96c6c52072e396495bc77a6c767e750a3731c3ef3da2eae102b1a3fcf846a6b0","observation_id":"50be2b67-81f4-4c61-a01a-4ed1c52d5940","resolution":{"observed_at":"2026-06-30T13:24:39.958038Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2160.00094","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T13:24:39.959365Z","title":"?”. Examples include“Complete: Above Nimbusglade floats ___","venue":null,"work_id":"8c304288-6aee-4c91-9280-c364232ccd44","year":null},"citing_paper":{"arxiv_id":"2605.24667","last_updated":"2026-05-23T17:10:20Z","snapshot_observed_at":"2026-08-01T07:37:33.980490Z","submitted_at":"2026-05-23T17:10:20Z","title":"When Mean CE Fails: Median CE Can Better Track Language Model Quality","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T13:23:55.114628Z"},"links":{"citing_paper":"/paper/2605.24667"},"observation_digest":"sha256:80aa902b46ec5ed8dbc72a4f6b3383036a0d405082ed18aced41e753d3a4a0e8","observation_id":"73242296-a5cc-4025-8218-df897c01fdea","resolution":{"observed_at":"2026-06-30T13:24:39.960958Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.292225Z","title":"Large”; 4-layer, 256-dim, 4 heads,∼8M params for “Small","venue":null,"work_id":"d5651727-fd93-4353-b557-270b724f2495","year":2016},"citing_paper":{"arxiv_id":"2605.24667","last_updated":"2026-05-23T17:10:20Z","snapshot_observed_at":"2026-08-01T07:37:33.980490Z","submitted_at":"2026-05-23T17:10:20Z","title":"When Mean CE Fails: Median CE Can Better Track Language Model Quality","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T13:23:55.114628Z"},"links":{"citing_paper":"/paper/2605.24667"},"observation_digest":"sha256:7333aa09302cd8046d41b96226b4939ee92aea73b924be14020c010e62370dcd","observation_id":"13209490-057f-40ac-9fec-9b2df9b6a257","resolution":{"observed_at":"2026-07-09T02:15:55.293452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.290582Z","title":null,"venue":null,"work_id":"e72455d9-47f0-4769-8344-0ce26f5c0641","year":2023},"citing_paper":{"arxiv_id":"2605.24667","last_updated":"2026-05-23T17:10:20Z","snapshot_observed_at":"2026-08-01T07:37:33.980490Z","submitted_at":"2026-05-23T17:10:20Z","title":"When Mean CE Fails: Median CE Can Better Track Language Model Quality","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T13:23:55.114628Z"},"links":{"citing_paper":"/paper/2605.24667"},"observation_digest":"sha256:7671690fea5b1894c767204d8ebcff598b143deee3abaec1365dd0866ccd67e8","observation_id":"504c4165-0fed-412a-b482-d6819d6adb7d","resolution":{"observed_at":"2026-07-09T02:15:55.291672Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.24667","last_updated":"2026-05-23T17:10:20Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-01T07:37:33.980490Z","submitted_at":"2026-05-23T17:10:20Z","title":"When Mean CE Fails: Median CE Can Better Track Language Model Quality"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":11,"verified_fuzzy":1},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2605.24667."}