{"as_of":"2026-08-19T18:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5cef08b2a1dedc66d6d6477786d813260339d4d9e5b647254a3595d72c0e389e","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-02T22:08:11.348274Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.16511/citation-record","integrity":"/paper/2606.16511/integrity","json":"/paper/2606.16511/citation-record.json","paper":"/paper/2606.16511"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T19:11:21.980695Z","title":null,"venue":null,"work_id":"7f733230-09b4-4dac-9174-e99aa124ba7c","year":null},"citing_paper":{"arxiv_id":"2606.16511","last_updated":"2026-07-01T12:49:23Z","snapshot_observed_at":"2026-08-13T00:28:30.971773Z","submitted_at":"2026-06-15T10:13:54Z","title":"Tail-Shape Estimation in LLM Evaluation Is Fragile: A Protocol for Diagnosing False Positives","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-02T22:08:11.348274Z"},"links":{"citing_paper":"/paper/2606.16511"},"observation_digest":"sha256:40d225e6a393b7f0cc6777c4aa901d7589b7f4fe89bbb01692d76eb425fbf3fd","observation_id":"9e199cb6-93d4-431a-aa60-9f98613b70c7","resolution":{"observed_at":"2026-07-05T19:11:21.982296Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T19:11:21.976150Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":"f988aa6e-24b8-4684-96c2-19f2ef08293d","year":2023},"citing_paper":{"arxiv_id":"2606.16511","last_updated":"2026-07-01T12:49:23Z","snapshot_observed_at":"2026-08-13T00:28:30.971773Z","submitted_at":"2026-06-15T10:13:54Z","title":"Tail-Shape Estimation in LLM Evaluation Is Fragile: A Protocol for Diagnosing False Positives","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-02T22:08:11.348274Z"},"links":{"citing_paper":"/paper/2606.16511"},"observation_digest":"sha256:b6c86fb4d4cea754bc22f9eb3d800c136bc947ecb8cb9c39c83779a0dcdb9c98","observation_id":"0efd2508-7d08-4190-b86a-03711de820c9","resolution":{"observed_at":"2026-07-05T19:11:21.980060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T19:11:21.982860Z","title":"The annals of statistics , pages=","venue":null,"work_id":"bcc93c35-319e-4211-9fb8-2aff62e5277c","year":1975},"citing_paper":{"arxiv_id":"2606.16511","last_updated":"2026-07-01T12:49:23Z","snapshot_observed_at":"2026-08-13T00:28:30.971773Z","submitted_at":"2026-06-15T10:13:54Z","title":"Tail-Shape Estimation in LLM Evaluation Is Fragile: A Protocol for Diagnosing False Positives","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-02T22:08:11.348274Z"},"links":{"citing_paper":"/paper/2606.16511"},"observation_digest":"sha256:9942fe32634d7d14b9c6e5fb23fd35ce0adc6bab6fa13e74ea8a89bc7b9753a8","observation_id":"2bb1ac28-1c63-460b-8a4b-302c18da28ac","resolution":{"observed_at":"2026-07-05T19:11:21.984226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T19:11:21.984780Z","title":null,"venue":null,"work_id":"5dc12df3-2b55-4e83-8683-8d0f62d2a837","year":null},"citing_paper":{"arxiv_id":"2606.16511","last_updated":"2026-07-01T12:49:23Z","snapshot_observed_at":"2026-08-13T00:28:30.971773Z","submitted_at":"2026-06-15T10:13:54Z","title":"Tail-Shape Estimation in LLM Evaluation Is Fragile: A Protocol for Diagnosing False Positives","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-02T22:08:11.348274Z"},"links":{"citing_paper":"/paper/2606.16511"},"observation_digest":"sha256:413a6cf2970e16e2d6fdc6185edfc4d627d003e3d90414d4ab5d6cbcd64f9d70","observation_id":"ec9091a5-6208-4703-9249-7419f20858c8","resolution":{"observed_at":"2026-07-05T19:11:21.985823Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T19:11:21.999444Z","title":"Journal of pharmacokinetics and biopharmaceutics , volume=","venue":null,"work_id":"192e7958-296e-4c44-bc7c-c2777c5c79cf","year":1987},"citing_paper":{"arxiv_id":"2606.16511","last_updated":"2026-07-01T12:49:23Z","snapshot_observed_at":"2026-08-13T00:28:30.971773Z","submitted_at":"2026-06-15T10:13:54Z","title":"Tail-Shape Estimation in LLM Evaluation Is Fragile: A Protocol for Diagnosing False Positives","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-02T22:08:11.348274Z"},"links":{"citing_paper":"/paper/2606.16511"},"observation_digest":"sha256:6b9733c375b657cda269e2900cf868dfa4bd9d6b3f54020ff0be7ad58954631a","observation_id":"241ef660-2d8f-4f8c-b1e2-b78d5a219ff5","resolution":{"observed_at":"2026-07-05T19:11:22.000880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T19:11:22.005360Z","title":"Proceedings of the 56th annual meeting of the association for computational linguistics (volume 1: Long papers) , pages=","venue":null,"work_id":"a7cc6b3c-874f-4e79-b285-bd76c9aa8d94","year":null},"citing_paper":{"arxiv_id":"2606.16511","last_updated":"2026-07-01T12:49:23Z","snapshot_observed_at":"2026-08-13T00:28:30.971773Z","submitted_at":"2026-06-15T10:13:54Z","title":"Tail-Shape Estimation in LLM Evaluation Is Fragile: A Protocol for Diagnosing False Positives","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-02T22:08:11.348274Z"},"links":{"citing_paper":"/paper/2606.16511"},"observation_digest":"sha256:8bf239fef64b05eb9fc4ae20a38d88f7d60d2641b08a82cd65ec180eecfefddf","observation_id":"e54a0e5b-a504-444e-966c-ef70679216e3","resolution":{"observed_at":"2026-07-05T19:11:22.006895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06815","last_updated":"2022-04-14T08:24:37Z","snapshot_observed_at":"2026-08-16T17:07:00.209146Z","submitted_at":"2022-04-14T08:24:37Z","title":"deep-significance - Easy and Meaningful Statistical Significance Testing in the Age of Neural Networks","version":1},"cited_work":{"arxiv_id":"2204.06815","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2204.06815","snapshot_observed_at":"2026-07-02T22:17:25.816607Z","title":"arXiv preprint arXiv:2204.06815 , year=","venue":null,"work_id":"eecc1509-9eb1-4fd5-9e19-7a8334599325","year":null},"citing_paper":{"arxiv_id":"2606.16511","last_updated":"2026-07-01T12:49:23Z","snapshot_observed_at":"2026-08-13T00:28:30.971773Z","submitted_at":"2026-06-15T10:13:54Z","title":"Tail-Shape Estimation in LLM Evaluation Is Fragile: A Protocol for Diagnosing False Positives","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-02T22:08:11.348274Z"},"links":{"cited_paper":"/paper/2204.06815","citing_paper":"/paper/2606.16511"},"observation_digest":"sha256:eb827bc4fb2a367d56b049d3768f2442c491b9283fb97386979a24372344dffc","observation_id":"0a686138-e3af-466b-8b2b-f286ae524d1b","resolution":{"observed_at":"2026-07-02T22:17:25.821554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T19:11:22.003250Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":"831e0876-067f-4f87-a7a2-ef54b1181ee7","year":2024},"citing_paper":{"arxiv_id":"2606.16511","last_updated":"2026-07-01T12:49:23Z","snapshot_observed_at":"2026-08-13T00:28:30.971773Z","submitted_at":"2026-06-15T10:13:54Z","title":"Tail-Shape Estimation in LLM Evaluation Is Fragile: A Protocol for Diagnosing False Positives","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-02T22:08:11.348274Z"},"links":{"citing_paper":"/paper/2606.16511"},"observation_digest":"sha256:eb132769225a9c354ac58dc2e4685ecb2b0d43acf1cf41fada65fdb1d051a7be","observation_id":"c398b99c-57f5-42ce-a0af-57054d0bc82c","resolution":{"observed_at":"2026-07-05T19:11:22.004771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T19:11:21.997555Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"0fc283e4-be58-4278-9cb3-e108d486c253","year":null},"citing_paper":{"arxiv_id":"2606.16511","last_updated":"2026-07-01T12:49:23Z","snapshot_observed_at":"2026-08-13T00:28:30.971773Z","submitted_at":"2026-06-15T10:13:54Z","title":"Tail-Shape Estimation in LLM Evaluation Is Fragile: A Protocol for Diagnosing False Positives","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-02T22:08:11.348274Z"},"links":{"citing_paper":"/paper/2606.16511"},"observation_digest":"sha256:f3010a89d45e213e52891cb36427c336e86b14d63e081c73b33883cac9d860bb","observation_id":"f2ed9167-94d4-4f57-85ce-a074309b075b","resolution":{"observed_at":"2026-07-05T19:11:21.998841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.22636","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T22:17:25.822639Z","title":"Statistical estimation of adversarial risk in large language models under best-of-n sampling","venue":null,"work_id":"330cb107-1846-4474-b556-93f9905bec81","year":2026},"citing_paper":{"arxiv_id":"2606.16511","last_updated":"2026-07-01T12:49:23Z","snapshot_observed_at":"2026-08-13T00:28:30.971773Z","submitted_at":"2026-06-15T10:13:54Z","title":"Tail-Shape Estimation in LLM Evaluation Is Fragile: A Protocol for Diagnosing False Positives","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-02T22:08:11.348274Z"},"links":{"citing_paper":"/paper/2606.16511"},"observation_digest":"sha256:98021804b6882ccd1f349877f24b5611127a26fc85cd1b736a406a5520fb1d6a","observation_id":"2163ac17-9b51-4b65-be3e-b023e77eaea2","resolution":{"observed_at":"2026-07-02T22:17:25.824253Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T19:11:22.001496Z","title":"6th International Conference on Learning Representations, ICLR 2018 , year=","venue":null,"work_id":"fd2c7e62-ae86-4a17-9d6f-8d323d0cc8fc","year":2018},"citing_paper":{"arxiv_id":"2606.16511","last_updated":"2026-07-01T12:49:23Z","snapshot_observed_at":"2026-08-13T00:28:30.971773Z","submitted_at":"2026-06-15T10:13:54Z","title":"Tail-Shape Estimation in LLM Evaluation Is Fragile: A Protocol for Diagnosing False Positives","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-02T22:08:11.348274Z"},"links":{"citing_paper":"/paper/2606.16511"},"observation_digest":"sha256:11bcc4d30912fdd70916b61668faf910df3e952d0b668d143affa846b0022d5c","observation_id":"71438cb3-068e-4a2f-b7e1-c765ea69d801","resolution":{"observed_at":"2026-07-05T19:11:22.002750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T19:11:21.995720Z","title":"Findings of the association for computational linguistics: EMNLP 2020 , pages=","venue":null,"work_id":"67caebdf-0c4d-4465-8947-bc6e9dade16d","year":2020},"citing_paper":{"arxiv_id":"2606.16511","last_updated":"2026-07-01T12:49:23Z","snapshot_observed_at":"2026-08-13T00:28:30.971773Z","submitted_at":"2026-06-15T10:13:54Z","title":"Tail-Shape Estimation in LLM Evaluation Is Fragile: A Protocol for Diagnosing False Positives","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-02T22:08:11.348274Z"},"links":{"citing_paper":"/paper/2606.16511"},"observation_digest":"sha256:5bdce0ad0154f9296e55abe4ba163c89f527addfde09ec0ae4e9202f22464075","observation_id":"a744532f-d70d-42f5-ae2b-42a54dff87a6","resolution":{"observed_at":"2026-07-05T19:11:21.997022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T19:11:21.993826Z","title":"the Annals of Statistics , pages=","venue":null,"work_id":"0538e18c-bc59-475a-8903-15ed70399c16","year":1975},"citing_paper":{"arxiv_id":"2606.16511","last_updated":"2026-07-01T12:49:23Z","snapshot_observed_at":"2026-08-13T00:28:30.971773Z","submitted_at":"2026-06-15T10:13:54Z","title":"Tail-Shape Estimation in LLM Evaluation Is Fragile: A Protocol for Diagnosing False Positives","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-02T22:08:11.348274Z"},"links":{"citing_paper":"/paper/2606.16511"},"observation_digest":"sha256:1cfbd14ca1e144670d47bcfeca7879d5e6c6a6391bc579aecf2f67f189bbef78","observation_id":"797a48ab-585a-4e92-a192-9f562d2f5925","resolution":{"observed_at":"2026-07-05T19:11:21.995159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T19:11:21.989963Z","title":"The annals of Statistics , pages=","venue":null,"work_id":"41a85c4f-c5dd-49bf-a576-d11aaa27542d","year":1987},"citing_paper":{"arxiv_id":"2606.16511","last_updated":"2026-07-01T12:49:23Z","snapshot_observed_at":"2026-08-13T00:28:30.971773Z","submitted_at":"2026-06-15T10:13:54Z","title":"Tail-Shape Estimation in LLM Evaluation Is Fragile: A Protocol for Diagnosing False Positives","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-02T22:08:11.348274Z"},"links":{"citing_paper":"/paper/2606.16511"},"observation_digest":"sha256:b4c3fc25cf803db387c9c79ea1c5cc76989165af92fa78592f9f309714ab71b7","observation_id":"723e54d1-c7c7-4dac-b8a7-41b8f554e806","resolution":{"observed_at":"2026-07-05T19:11:21.991207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T19:11:21.991932Z","title":"2001 , publisher=","venue":null,"work_id":"232fbe0d-5be4-4087-8daf-67180b1dd51e","year":2001},"citing_paper":{"arxiv_id":"2606.16511","last_updated":"2026-07-01T12:49:23Z","snapshot_observed_at":"2026-08-13T00:28:30.971773Z","submitted_at":"2026-06-15T10:13:54Z","title":"Tail-Shape Estimation in LLM Evaluation Is Fragile: A Protocol for Diagnosing False Positives","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-02T22:08:11.348274Z"},"links":{"citing_paper":"/paper/2606.16511"},"observation_digest":"sha256:8da6da168b3d5d0df1065a4a198199c7324a227c51dca5a5b180a89ef259839f","observation_id":"c5aec8b7-230e-400b-be60-91764ecf7ebc","resolution":{"observed_at":"2026-07-05T19:11:21.993245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T19:11:21.988240Z","title":"Choulakian and M","venue":null,"work_id":"04a90a9c-0f03-4d65-a2d4-4adad1e2c9bf","year":null},"citing_paper":{"arxiv_id":"2606.16511","last_updated":"2026-07-01T12:49:23Z","snapshot_observed_at":"2026-08-13T00:28:30.971773Z","submitted_at":"2026-06-15T10:13:54Z","title":"Tail-Shape Estimation in LLM Evaluation Is Fragile: A Protocol for Diagnosing False Positives","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-02T22:08:11.348274Z"},"links":{"citing_paper":"/paper/2606.16511"},"observation_digest":"sha256:61f70d1a9b28c45c3289c7df95e5c5b81f4da6c35258f29fe5b527add5deec65","observation_id":"d4a08dca-f14c-49dc-8e2e-fd61f27c6b8d","resolution":{"observed_at":"2026-07-05T19:11:21.989401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T11:36:12.788904Z","title":"2025 , eprint=","venue":null,"work_id":"b1a2cc9b-8086-427e-830d-991890d05419","year":2025},"citing_paper":{"arxiv_id":"2606.16511","last_updated":"2026-07-01T12:49:23Z","snapshot_observed_at":"2026-08-13T00:28:30.971773Z","submitted_at":"2026-06-15T10:13:54Z","title":"Tail-Shape Estimation in LLM Evaluation Is Fragile: A Protocol for Diagnosing False Positives","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-02T22:08:11.348274Z"},"links":{"citing_paper":"/paper/2606.16511"},"observation_digest":"sha256:1e4b4a2f4370f204de0e01c6601a5853256e0db8101a7d61c2f9227b462934ba","observation_id":"cf5c070c-376f-4318-88ef-4ac4ea8485ea","resolution":{"observed_at":"2026-07-05T19:11:21.975444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T04:46:46.700327Z","title":"2024 , eprint=","venue":null,"work_id":"94860f33-c1e9-46de-b7ef-cdfde74468a5","year":2024},"citing_paper":{"arxiv_id":"2606.16511","last_updated":"2026-07-01T12:49:23Z","snapshot_observed_at":"2026-08-13T00:28:30.971773Z","submitted_at":"2026-06-15T10:13:54Z","title":"Tail-Shape Estimation in LLM Evaluation Is Fragile: A Protocol for Diagnosing False Positives","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-02T22:08:11.348274Z"},"links":{"citing_paper":"/paper/2606.16511"},"observation_digest":"sha256:e6d8581ee044a937520d7aa134939bcef88cd3437f7dbc5563a5abeb6610c81d","observation_id":"2c09005a-b2ef-49c5-a7b1-61a10dad3090","resolution":{"observed_at":"2026-07-05T19:11:21.987702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.16511","last_updated":"2026-07-01T12:49:23Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T00:28:30.971773Z","submitted_at":"2026-06-15T10:13:54Z","title":"Tail-Shape Estimation in LLM Evaluation Is Fragile: A Protocol for Diagnosing False Positives"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":2,"verified_exact":1,"verified_fuzzy":14},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2606.16511."}