{"as_of":"2026-08-05T20:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fa4dda8c48d830235571386627461dcbe7fa6b805fa662daa0d87dd549c7594e","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.26101/citation-record","integrity":"/paper/2606.26101/integrity","json":"/paper/2606.26101/citation-record.json","paper":"/paper/2606.26101"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-07-06T14:08:18.855958Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":"2210.11416","doi":"10.48550/arxiv.2210.11416","metadata_source":"pith","pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Instruction-Finetuned Language Models","venue":"cs.LG","work_id":"8405abb1-7558-4fdf-af24-f4c52fa77a06","year":2022},"citing_paper":{"arxiv_id":"2606.26101","last_updated":"2026-04-30T05:46:01Z","snapshot_observed_at":"2026-08-03T03:20:52.778662Z","submitted_at":"2026-04-30T05:46:01Z","title":"Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-01T08:57:27.245873Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2606.26101"},"observation_digest":"sha256:0171d71a9b1d3b8e80fda102a45b56859d9869a3c5f8e42bdc48c8d37e2b7e59","observation_id":"1571246f-11f3-4006-b6dc-0ca715a1708b","resolution":{"observed_at":"2026-07-01T09:05:36.957648Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15938","last_updated":"2024-05-31T17:49:03Z","snapshot_observed_at":"2026-08-03T17:29:17.531819Z","submitted_at":"2024-02-24T23:54:41Z","title":"Generalization or Memorization: Data Contamination and Trustworthy Evaluation for Large Language Models","version":3},"cited_work":{"arxiv_id":"2402.15938","doi":"10.48550/arxiv.2402.15938","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15938","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"General- ization or memorization: Data contamination and trustworthy evaluation for large language models","venue":"arXiv (Cornell University)","work_id":"8d621199-da61-43f3-aa97-37730ee1570c","year":2024},"citing_paper":{"arxiv_id":"2606.26101","last_updated":"2026-04-30T05:46:01Z","snapshot_observed_at":"2026-08-03T03:20:52.778662Z","submitted_at":"2026-04-30T05:46:01Z","title":"Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-01T08:57:27.245873Z"},"links":{"cited_paper":"/paper/2402.15938","citing_paper":"/paper/2606.26101"},"observation_digest":"sha256:f2eb0de80c29416191783ad218c0e8420b88e7d1fb6dcbfd2ee5e5563c5d860a","observation_id":"4705e333-1be6-41ef-92e9-d7cde28a5d5f","resolution":{"observed_at":"2026-07-01T09:05:36.963144Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3458723","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URL https://cacm.acm.org/research/ datasheets-for-datasets/","venue":"Communications of the ACM","work_id":"8459c6a3-b938-49db-a41c-c7e19df646bd","year":2021},"citing_paper":{"arxiv_id":"2606.26101","last_updated":"2026-04-30T05:46:01Z","snapshot_observed_at":"2026-08-03T03:20:52.778662Z","submitted_at":"2026-04-30T05:46:01Z","title":"Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-01T08:57:27.245873Z"},"links":{"citing_paper":"/paper/2606.26101"},"observation_digest":"sha256:df00f926c2cc6822795cef5a514d33623f10b6976006150cdd9c2d1640962a3e","observation_id":"d5bff1e0-f52f-450c-ae9b-1fbed211e777","resolution":{"observed_at":"2026-07-01T09:05:36.080875Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T06:49:00.08385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T06:49:00.08385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:22:26.593203Z","title":"In: Proceedings of the 36th International Conference on Ma- chine Learning","venue":null,"work_id":"9ad26596-03f8-482c-82f5-76d08840c60f","year":2019},"citing_paper":{"arxiv_id":"2606.26101","last_updated":"2026-04-30T05:46:01Z","snapshot_observed_at":"2026-08-03T03:20:52.778662Z","submitted_at":"2026-04-30T05:46:01Z","title":"Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-01T08:57:27.245873Z"},"links":{"citing_paper":"/paper/2606.26101"},"observation_digest":"sha256:518d563e8552736ba0ea92648aaece2f49c18f0f44ea849925a95e1f36375ac9","observation_id":"6008bf2a-5605-468b-8293-4bf32457fcf4","resolution":{"observed_at":"2026-07-06T12:22:26.594491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2606.26101","last_updated":"2026-04-30T05:46:01Z","snapshot_observed_at":"2026-08-03T03:20:52.778662Z","submitted_at":"2026-04-30T05:46:01Z","title":"Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-01T08:57:27.245873Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2606.26101"},"observation_digest":"sha256:3c79c31c1d24ac9e15edcf598cfa167ae7cf0b1c7af2883696384abdcff6fa79","observation_id":"85f0cd48-cf01-4545-a83c-0e1232f8c578","resolution":{"observed_at":"2026-07-01T09:05:36.948534Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:22:26.599143Z","title":"In: Proceedings of the 34th International Conference on Machine Learn- ing","venue":null,"work_id":"7c3974c4-2ee5-4491-b3ee-a6b931d78e23","year":2017},"citing_paper":{"arxiv_id":"2606.26101","last_updated":"2026-04-30T05:46:01Z","snapshot_observed_at":"2026-08-03T03:20:52.778662Z","submitted_at":"2026-04-30T05:46:01Z","title":"Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-01T08:57:27.245873Z"},"links":{"citing_paper":"/paper/2606.26101"},"observation_digest":"sha256:462c013709a2514a3588d0f4599021bbbccc4d34cbc82cc2e731769496d7fffb","observation_id":"7a8fc836-2e68-40d1-82db-e81a59a3c42f","resolution":{"observed_at":"2026-07-06T12:22:26.600414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/p17-1147","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T12:46:14.489252Z","title":"TriviaQA: A large scale distantly supervised challenge dataset for reading comprehension","venue":"Proceedings of the 55th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","work_id":"d05a9c57-9d88-473a-aa65-efb13f9dee25","year":2017},"citing_paper":{"arxiv_id":"2606.26101","last_updated":"2026-04-30T05:46:01Z","snapshot_observed_at":"2026-08-03T03:20:52.778662Z","submitted_at":"2026-04-30T05:46:01Z","title":"Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-01T08:57:27.245873Z"},"links":{"citing_paper":"/paper/2606.26101"},"observation_digest":"sha256:effb49dbffefe38d4ec49f01f136db5dbcdaafdac036e4906720b039599b5612","observation_id":"ac973313-5ea8-44e9-b397-1c69f7e586a5","resolution":{"observed_at":"2026-07-01T09:05:36.092963Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T09:08:04.800216+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T09:08:04.800216+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":"2207.05221","doi":"10.1145/3618260.3649777","metadata_source":"pith","pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Models (Mostly) Know What They Know","venue":"cs.CL","work_id":"8ca58a10-da41-4f70-baae-7e449512e345","year":2022},"citing_paper":{"arxiv_id":"2606.26101","last_updated":"2026-04-30T05:46:01Z","snapshot_observed_at":"2026-08-03T03:20:52.778662Z","submitted_at":"2026-04-30T05:46:01Z","title":"Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-01T08:57:27.245873Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2606.26101"},"observation_digest":"sha256:c5912b1321c34da388dc259e2ae74798591b71212a28c27b2ce33f3b75184733","observation_id":"43e3f1a1-1eb9-4ea9-b83e-ec31f698ee5a","resolution":{"observed_at":"2026-07-01T09:05:36.954309Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:53:13.382372+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:53:13.382372+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.emnlp-main.397","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T13:36:58.245083Z","title":"HaluEval: A Large-Scale Hallucination Evaluation Benchmark for Large Language Models","venue":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing","work_id":"e6b96d1b-7944-4233-8a28-a097f26db294","year":2023},"citing_paper":{"arxiv_id":"2606.26101","last_updated":"2026-04-30T05:46:01Z","snapshot_observed_at":"2026-08-03T03:20:52.778662Z","submitted_at":"2026-04-30T05:46:01Z","title":"Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-01T08:57:27.245873Z"},"links":{"citing_paper":"/paper/2606.26101"},"observation_digest":"sha256:6be72da55a592d28546e09123c7b99e0592e8f5955b7158ec2228cb9ee7b7c9e","observation_id":"8bbd5728-5fed-4585-a0e9-8132360b2f11","resolution":{"observed_at":"2026-07-01T09:05:36.102516Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T01:22:54.648351+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T01:22:54.648351+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v38i17.29822","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Pro- ceedings of the AAAIConference on Artificial Intelligence.vol","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"d4dcef60-f22b-4d3d-8fb5-bad47bd573b0","year":2024},"citing_paper":{"arxiv_id":"2606.26101","last_updated":"2026-04-30T05:46:01Z","snapshot_observed_at":"2026-08-03T03:20:52.778662Z","submitted_at":"2026-04-30T05:46:01Z","title":"Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-01T08:57:27.245873Z"},"links":{"citing_paper":"/paper/2606.26101"},"observation_digest":"sha256:ec6e3e6f20edd53eee3a3954e15063497b224c28995fc6d51aa4ba14cdb6fe5f","observation_id":"ee1fb371-3321-4279-87c4-dfa4abf9d5fc","resolution":{"observed_at":"2026-07-01T09:05:36.089862Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-emnlp.30","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An open-source data contamination report for large language models","venue":null,"work_id":"b308a8bd-e3ad-4cfe-a014-308b45fa7c65","year":2024},"citing_paper":{"arxiv_id":"2606.26101","last_updated":"2026-04-30T05:46:01Z","snapshot_observed_at":"2026-08-03T03:20:52.778662Z","submitted_at":"2026-04-30T05:46:01Z","title":"Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-01T08:57:27.245873Z"},"links":{"citing_paper":"/paper/2606.26101"},"observation_digest":"sha256:1e2e3d25e53850d2f196703d4b400aa904ded7a24f277dc9666c58a260c0b513","observation_id":"17f0b81a-0a05-4539-be7f-14216fbb031d","resolution":{"observed_at":"2026-07-01T09:05:36.076301Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2606.26101","last_updated":"2026-04-30T05:46:01Z","snapshot_observed_at":"2026-08-03T03:20:52.778662Z","submitted_at":"2026-04-30T05:46:01Z","title":"Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-01T08:57:27.245873Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2606.26101"},"observation_digest":"sha256:fd3437e67fe2a8dcfacb5b3a3885d3b8e915e31e0234025e83a7882a35e8ae30","observation_id":"5be028f1-7993-4a7f-9640-1c42cd084527","resolution":{"observed_at":"2026-07-01T09:05:36.959322Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:22:26.597203Z","title":"In: Proceedings of the 60th Annual Meeting of the Association for Com- putational Linguistics (Volume 1: Long Papers)","venue":null,"work_id":"75fdb858-193f-43e9-98a0-b68f039f04ff","year":2022},"citing_paper":{"arxiv_id":"2606.26101","last_updated":"2026-04-30T05:46:01Z","snapshot_observed_at":"2026-08-03T03:20:52.778662Z","submitted_at":"2026-04-30T05:46:01Z","title":"Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-01T08:57:27.245873Z"},"links":{"citing_paper":"/paper/2606.26101"},"observation_digest":"sha256:d01ce4eb47708fd9fc2d903fc7547a034ec7dd4bf378c70a3cc19a86b61a0df5","observation_id":"54a8626c-1d8b-4f96-aeb6-3357f1287fc8","resolution":{"observed_at":"2026-07-06T12:22:26.598419Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:22:26.595198Z","title":"In: Proceedings of the Conference on Health, Inference, and Learning","venue":null,"work_id":"6105cffb-c114-4297-944d-2e3df5f7ffd8","year":2022},"citing_paper":{"arxiv_id":"2606.26101","last_updated":"2026-04-30T05:46:01Z","snapshot_observed_at":"2026-08-03T03:20:52.778662Z","submitted_at":"2026-04-30T05:46:01Z","title":"Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-01T08:57:27.245873Z"},"links":{"citing_paper":"/paper/2606.26101"},"observation_digest":"sha256:a5e744d8650b47ccca896dd1cb16ae549d76d64ded143db743c46dd41fcf81cf","observation_id":"2fd13d21-f553-42b2-95d4-344f09233a54","resolution":{"observed_at":"2026-07-06T12:22:26.596592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.conda-1.3","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Proceedings of the 1st Workshop on Data Contamination (CONDA)","venue":null,"work_id":"a3b1b380-46ce-47dd-a775-2b7fdb70a8ed","year":2024},"citing_paper":{"arxiv_id":"2606.26101","last_updated":"2026-04-30T05:46:01Z","snapshot_observed_at":"2026-08-03T03:20:52.778662Z","submitted_at":"2026-04-30T05:46:01Z","title":"Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-01T08:57:27.245873Z"},"links":{"citing_paper":"/paper/2606.26101"},"observation_digest":"sha256:e7df8b4ec3b2d3b88bc92b5c02eafec66fe532fcf0ea98603ce4f23e6e4d8fe9","observation_id":"07dc27c9-6851-4d9c-a1d6-a7d5a27f8cb7","resolution":{"observed_at":"2026-07-01T09:05:36.083472Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2606.26101","last_updated":"2026-04-30T05:46:01Z","snapshot_observed_at":"2026-08-03T03:20:52.778662Z","submitted_at":"2026-04-30T05:46:01Z","title":"Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-01T08:57:27.245873Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2606.26101"},"observation_digest":"sha256:39cddb13639395e600720c2a18b282b4204ebdc4cf38a29f59a6fc7e9cee34fc","observation_id":"3d69a9d5-d1d2-4455-b0f6-b523c249539d","resolution":{"observed_at":"2026-07-01T09:05:36.947075Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/n19-1421","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi: 10.18653/v1/n19-1421","venue":null,"work_id":"628930d3-897c-43a2-8d6d-589da959e066","year":2019},"citing_paper":{"arxiv_id":"2606.26101","last_updated":"2026-04-30T05:46:01Z","snapshot_observed_at":"2026-08-03T03:20:52.778662Z","submitted_at":"2026-04-30T05:46:01Z","title":"Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-01T08:57:27.245873Z"},"links":{"citing_paper":"/paper/2606.26101"},"observation_digest":"sha256:7f881cc32c9bdc7abacf193eec00e913cc79211a6335534c41126aa52850a87b","observation_id":"4c629551-4019-4d39-b795-cdc02127514d","resolution":{"observed_at":"2026-07-01T09:05:36.088118Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T09:08:04.850966+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T09:08:04.850966+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.repl4nlp-1.23","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Proceedings of the 7th Workshop on Representation Learn- ing for NLP","venue":null,"work_id":"99104493-123b-4caf-a451-4bb06ae106d5","year":2022},"citing_paper":{"arxiv_id":"2606.26101","last_updated":"2026-04-30T05:46:01Z","snapshot_observed_at":"2026-08-03T03:20:52.778662Z","submitted_at":"2026-04-30T05:46:01Z","title":"Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-01T08:57:27.245873Z"},"links":{"citing_paper":"/paper/2606.26101"},"observation_digest":"sha256:987debba17bb557d66a2e55a7b3a85c27b51229334ed9543bc973eddd93f13e8","observation_id":"0fefe833-0213-4d9c-a043-21a0ff7b4c41","resolution":{"observed_at":"2026-07-01T09:05:36.098832Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-acl","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unveiling the achilles’ heel of NLG evaluators: A unified adversarial framework driven by large language models","venue":null,"work_id":"86baafc8-462c-4c5d-9763-7d36c68a439e","year":2024},"citing_paper":{"arxiv_id":"2606.26101","last_updated":"2026-04-30T05:46:01Z","snapshot_observed_at":"2026-08-03T03:20:52.778662Z","submitted_at":"2026-04-30T05:46:01Z","title":"Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-01T08:57:27.245873Z"},"links":{"citing_paper":"/paper/2606.26101"},"observation_digest":"sha256:76d33a8c2f0a8e12187d3b75d1671a4dd824b83aea3daa3722d3d42f7bd2da1c","observation_id":"7969dd46-8397-46ee-9368-440a89cde1fb","resolution":{"observed_at":"2026-07-01T09:05:36.071473Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T01:24:50.443461+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T01:24:50.443461+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06209","last_updated":"2017-07-19T17:28:46Z","snapshot_observed_at":"2026-07-06T05:51:51.253539Z","submitted_at":"2017-07-19T17:28:46Z","title":"Crowdsourcing Multiple Choice Science Questions","version":1},"cited_work":{"arxiv_id":"1707.06209","doi":null,"metadata_source":"pith","pith_arxiv_id":"1707.06209","snapshot_observed_at":"2026-07-04T00:59:20.987277Z","title":"Crowdsourcing Multiple Choice Science Questions","venue":"cs.HC","work_id":"d186f73e-dc39-4d8f-9c07-fb134a60433d","year":2017},"citing_paper":{"arxiv_id":"2606.26101","last_updated":"2026-04-30T05:46:01Z","snapshot_observed_at":"2026-08-03T03:20:52.778662Z","submitted_at":"2026-04-30T05:46:01Z","title":"Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/1707.06209","citing_paper":"/paper/2606.26101"},"observation_digest":"sha256:6a09d95a9e90bf2d56cbee677fd28c3da7d31b7303e7186cba04ab1d12c2e2b4","observation_id":"159196e4-15a3-445b-8128-5546509fbc5b","resolution":{"observed_at":"2026-07-01T09:05:36.078054Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/tacl_a_00754","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URL https://aclanthology.org/2025.tacl-1.26/","venue":"Transactions of the Association for Computational Linguistics","work_id":"25dbc02e-2fd0-441a-9158-2e055853b042","year":2025},"citing_paper":{"arxiv_id":"2606.26101","last_updated":"2026-04-30T05:46:01Z","snapshot_observed_at":"2026-08-03T03:20:52.778662Z","submitted_at":"2026-04-30T05:46:01Z","title":"Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-01T08:57:27.245873Z"},"links":{"citing_paper":"/paper/2606.26101"},"observation_digest":"sha256:5f82bfe49e2010e3c48441debda93086a0e4c8d80be734055d1bb43d6677524c","observation_id":"8b9a5a34-e44b-4324-8e57-810aed9be3f7","resolution":{"observed_at":"2026-07-01T09:05:36.082120Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T08:53:22.635938+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T08:53:22.635938+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d18-1259","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:19:12.561642Z","title":"Cohen and Ruslan Salakhutdinov and Christopher D","venue":"Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing","work_id":"3c5a795a-85bd-45a1-8e65-06a9c5641111","year":2018},"citing_paper":{"arxiv_id":"2606.26101","last_updated":"2026-04-30T05:46:01Z","snapshot_observed_at":"2026-08-03T03:20:52.778662Z","submitted_at":"2026-04-30T05:46:01Z","title":"Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-01T08:57:27.245873Z"},"links":{"citing_paper":"/paper/2606.26101"},"observation_digest":"sha256:6141dff4b245c0b3fbb1504b3b32e7998fbfe1a330a069eb18755f2076ffe504","observation_id":"82b7696e-e99c-44a9-8a67-12d18264f3a1","resolution":{"observed_at":"2026-07-01T09:05:36.087085Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-13T13:50:33.333125+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T13:50:33.333125+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.124","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmarking","venue":null,"work_id":"ba65af59-456b-42fa-9423-c7cf0cf71817","year":2024},"citing_paper":{"arxiv_id":"2606.26101","last_updated":"2026-04-30T05:46:01Z","snapshot_observed_at":"2026-08-03T03:20:52.778662Z","submitted_at":"2026-04-30T05:46:01Z","title":"Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-01T08:57:27.245873Z"},"links":{"citing_paper":"/paper/2606.26101"},"observation_digest":"sha256:ec450edc070a040bdcda26611ec380d1f7d05d69bae96bfaacb2c0e8a49dd8e7","observation_id":"f16bc3af-0571-4de1-b063-5b8c30dade67","resolution":{"observed_at":"2026-07-01T09:05:36.095388Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.26101","last_updated":"2026-04-30T05:46:01Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-03T03:20:52.778662Z","submitted_at":"2026-04-30T05:46:01Z","title":"Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":1,"metadata_mismatch":11,"parse_uncertain":0,"unresolved":0,"verified_exact":8,"verified_fuzzy":3},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2606.26101."}