{"as_of":"2026-08-07T17:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1f0ce1b562f365a50122f544c4952e5c6d50f452f4e4534e13242c98ea28ccdd","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:57:10.932988Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.12376/citation-record","integrity":"/paper/2506.12376/integrity","json":"/paper/2506.12376/citation-record.json","paper":"/paper/2506.12376"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T00:57:10.821107Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.821107Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:3f180646ffc2175aa28bc6813fb013c7acd7f61bf1bf2e9c989848f5dc2813b1","observation_id":"4d050e6a-69c9-40f2-929a-0363616f7a0b","resolution":{"observed_at":"2026-08-07T00:57:10.821107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:11.382038Z","title":null,"venue":null,"work_id":"3bb85ea4-a068-4697-9f37-4a005af304a3","year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.825536Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:0afb0dbb178b872994c14b97ca1dfe24e1a02c456fc574fb6ea68deee838cc08","observation_id":"ad1334f8-3b07-44fe-ba21-7ea852ba5ddf","resolution":{"observed_at":"2026-08-07T00:57:11.385892Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:10.830526Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.830526Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:83bcf2f21acb70c18f57946670f881abde105c8b312d40f9638b776bcf041eff","observation_id":"2f840291-5fd4-41d5-aefd-257aa267c3cd","resolution":{"observed_at":"2026-08-07T00:57:10.830526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:11.372172Z","title":null,"venue":null,"work_id":"1689e756-fd84-442b-af2b-b93b26919938","year":2018},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.834151Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:1900cd597d2870442bcec9f777cf93c54d222cb4674de15a5904b6813b9df722","observation_id":"3bd6c51b-ed0b-4e60-8830-8115d7f6ea1a","resolution":{"observed_at":"2026-08-07T00:57:11.375353Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-07T00:57:10.837613Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.837613Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:27127e07d9cffb110cdc1b232b1de8c28e071a67baa41cfa0d355ac057d06cc5","observation_id":"8778659d-18f0-4202-a4ae-92c2799d5c1f","resolution":{"observed_at":"2026-08-07T00:57:10.837613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T00:57:10.840876Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.840876Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:9591e835f0c3b449987badb204baf97d331fea37efbf2ee2018e90ac5ba10164","observation_id":"7cfb0def-27cc-495f-a134-7dd54ae0430a","resolution":{"observed_at":"2026-08-07T00:57:10.840876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:11.362827Z","title":null,"venue":null,"work_id":"c133045c-f478-4ea7-9f94-ad39676efde9","year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.844622Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:7e6a5af1c00d8d9cafc3d21faef3b98fa9772202495878aa6864b52ae7c97628","observation_id":"cb38e085-ba45-4357-baa4-dc0d0c94f7a4","resolution":{"observed_at":"2026-08-07T00:57:11.366029Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:11.352884Z","title":null,"venue":null,"work_id":"48cbb54f-89d2-4157-9436-5851cfd6d884","year":1999},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.847412Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:57339cc7a72527d9551530c4bbff2d0382f621928a1d665856becf1266cb3095","observation_id":"08eb1bc9-ba21-4081-938e-685779d06d5d","resolution":{"observed_at":"2026-08-07T00:57:11.356190Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:10.850485Z","title":"Malin, Sricharan Kumar, and Jiaxin Zhang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.850485Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:74181500b0f76d3cc7a499e5c7696755a1938fd53799c5f14c86240e4464d4db","observation_id":"0433ecc0-9904-4509-9613-f476493d1bda","resolution":{"observed_at":"2026-08-07T00:57:10.850485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T00:57:10.853445Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.853445Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:10a6191b498c3f83aa069d6ea2a666e57dce79832358e314fb36724f53be986a","observation_id":"f19a296a-b8c6-4db2-a841-9e573f80affb","resolution":{"observed_at":"2026-08-07T00:57:10.853445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:11.343672Z","title":null,"venue":null,"work_id":"d76f419a-ec1a-4713-ba6d-3dcd4d0c8173","year":2021},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.856654Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:f9c1c71a678841e68f3aa5558b7de467cbc75f7916622922429c168655f005b6","observation_id":"bf334976-5606-46ea-920e-c8115ebb92d4","resolution":{"observed_at":"2026-08-07T00:57:11.346614Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T00:57:10.859209Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.859209Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:4dc9ad73a6b07f49c2f148ba1add0477ed1da885f1567d811bc85e4426b62cd7","observation_id":"7fb5c1bc-f0a8-4ee5-adf9-03af834ef47a","resolution":{"observed_at":"2026-08-07T00:57:10.859209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-07T13:04:50.040909Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-07T00:57:10.862036Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.862036Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:912bc218f90b21c35f04dad4708861a73dd9a4a59ea7c7569cf9bc967d02d6f7","observation_id":"3c540a06-3b16-476f-90cb-032bd58883f7","resolution":{"observed_at":"2026-08-07T00:57:10.862036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00515","last_updated":"2024-11-10T22:02:27Z","snapshot_observed_at":"2026-07-29T20:40:25.374189Z","submitted_at":"2024-06-01T17:48:15Z","title":"A Survey on Large Language Models for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00515","snapshot_observed_at":"2026-08-07T00:57:10.864820Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.864820Z"},"links":{"cited_paper":"/paper/2406.00515","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:52a5c0a76435eec82301d1aefac0ed98542c5008a52be0a30d9cd64b079b1806","observation_id":"766c3ef3-49ac-4d5a-b56d-6f7560111c2d","resolution":{"observed_at":"2026-08-07T00:57:10.864820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03983","last_updated":"2024-10-04T23:52:28Z","snapshot_observed_at":"2026-07-06T19:28:12.480864Z","submitted_at":"2024-10-04T23:52:28Z","title":"MetricX-24: The Google Submission to the WMT 2024 Metrics Shared Task","version":1},"cited_work":{"arxiv_id":"2410.03983","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.03983","snapshot_observed_at":"2026-08-07T00:57:11.204191Z","title":"MetricX-24: The Google Submission to the WMT 2024 Metrics Shared Task","venue":"cs.CL","work_id":"fc9f7f72-4d67-44e0-9ddd-8558e9fe2a42","year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.867801Z"},"links":{"cited_paper":"/paper/2410.03983","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:02b65f0bc5c97c4eec7e1961232ad1b584ba8ad83d3c19aa6125bd5be0898305","observation_id":"42595550-5a18-4443-a1df-1435d5ba8007","resolution":{"observed_at":"2026-08-07T00:57:11.208030Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19884","last_updated":"2024-07-29T11:01:17Z","snapshot_observed_at":"2026-07-06T18:53:13.875335Z","submitted_at":"2024-07-29T11:01:17Z","title":"Preliminary WMT24 Ranking of General MT Systems and LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19884","snapshot_observed_at":"2026-08-07T00:57:10.870910Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.870910Z"},"links":{"cited_paper":"/paper/2407.19884","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:43bd8995799141416f76c78a17555f1a9e2f2ef6f991e0d847be589fd8f080da","observation_id":"bd23c936-8285-4087-8950-e6fb2c9d78ed","resolution":{"observed_at":"2026-08-07T00:57:10.870910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16745","last_updated":"2024-01-30T04:50:28Z","snapshot_observed_at":"2026-07-06T17:22:15.248410Z","submitted_at":"2024-01-30T04:50:28Z","title":"MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16745","snapshot_observed_at":"2026-08-07T00:57:10.874023Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.874023Z"},"links":{"cited_paper":"/paper/2401.16745","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:1720db4d4e4d1454d9b1bebfb1105d743cf72b3cda25b83032e4455c37f99274","observation_id":"6371c8b8-2223-47bb-ae69-5fa74cfed51e","resolution":{"observed_at":"2026-08-07T00:57:10.874023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:10.877303Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.877303Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:a98a976112047165434948bb07d185a350cd9e80ab11008b3d5d70b8e9227b41","observation_id":"6edf4539-aaf9-4890-85f6-e98b888a3944","resolution":{"observed_at":"2026-08-07T00:57:10.877303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:11.326949Z","title":null,"venue":null,"work_id":"36912ae6-0c48-43a8-8477-f96ea8ab5d0e","year":2021},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.880538Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:d93af24dcb2fb70341407206cd2d1ffe27e1ec1cb66006314c09a08f2db66770","observation_id":"f35e663f-0bc7-4a89-8eb9-efd88d9bc290","resolution":{"observed_at":"2026-08-07T00:57:11.330094Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14053","last_updated":"2024-02-26T18:56:08Z","snapshot_observed_at":"2026-07-06T16:36:35.423639Z","submitted_at":"2023-10-21T16:14:56Z","title":"Beyond Accuracy: Evaluating Self-Consistency of Code Large Language Models with IdentityChain","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14053","snapshot_observed_at":"2026-08-07T00:57:10.885298Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.885298Z"},"links":{"cited_paper":"/paper/2310.14053","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:05ca81c1b382869b54cdeaa1f6326ee1500b058ed540ed76683f6a17efd487fc","observation_id":"bdd275b8-91d1-4a23-960b-b60932644982","resolution":{"observed_at":"2026-08-07T00:57:10.885298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06196","last_updated":"2025-03-23T14:51:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-09T05:37:09Z","title":"Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06196","snapshot_observed_at":"2026-08-07T00:57:10.888528Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.888528Z"},"links":{"cited_paper":"/paper/2402.06196","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:157568755b211c7fc133b0a5b460c28134ac54fc73e1f30b1f22e5f9cf89259b","observation_id":"1acbad04-91ff-47d4-9a66-16e92ff28842","resolution":{"observed_at":"2026-08-07T00:57:10.888528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:11.316564Z","title":null,"venue":null,"work_id":"5f8a1b99-e95a-464b-92d8-4f20138274ed","year":2002},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.891954Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:a2ac10c828f173b47681f2784ed8b2dc4201bdc416c27b9c770572d1f9f4a8f4","observation_id":"d6f0a735-8925-4de6-9463-b6d053771fc0","resolution":{"observed_at":"2026-08-07T00:57:11.320159Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T00:57:10.895294Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.895294Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:48ded764cb9969e7219457b72f3fe97ab2e00a435a231fb8933c0d13de9ba5ad","observation_id":"15b82ac5-ab48-4da9-9588-337a88546413","resolution":{"observed_at":"2026-08-07T00:57:10.895294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:10.898912Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.898912Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:af8587c0741e4995ed2ddee9ad5c84988510f1c7e673577aebf2cf19f16d42ef","observation_id":"0617a9c6-65c8-4ca7-ab18-677fab056174","resolution":{"observed_at":"2026-08-07T00:57:10.898912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11925","last_updated":"2023-09-21T09:38:56Z","snapshot_observed_at":"2026-07-06T16:21:41.556117Z","submitted_at":"2023-09-21T09:38:56Z","title":"Scaling up COMETKIWI: Unbabel-IST 2023 Submission for the Quality Estimation Shared Task","version":1},"cited_work":{"arxiv_id":"2309.11925","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11925","snapshot_observed_at":"2026-08-07T00:57:11.051120Z","title":"Scaling up COMETKIWI: Unbabel-IST 2023 Submission for the Quality Estimation Shared Task","venue":"cs.CL","work_id":"ecd259bd-6752-4040-8647-ea3f6dbc3138","year":2023},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.901731Z"},"links":{"cited_paper":"/paper/2309.11925","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:942d3e7b75bbb3f2df0d9c0e57a29ae5df5823cf974fdd777e37a929d82fe428","observation_id":"ca15a532-652c-452d-a539-bbda996e90c4","resolution":{"observed_at":"2026-08-07T00:57:11.055345Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:10.905184Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.905184Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:66560f692d1f5b9c925b299693bb6a8298f2ee0da7c84048fdc93a00ca79f0fb","observation_id":"b78b934b-c0c5-48e4-a050-5cde0f8bda71","resolution":{"observed_at":"2026-08-07T00:57:10.905184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T00:57:10.908249Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.908249Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:44d1fa3a7d1f827e129afb3dca6c81beab424f1d1f23b9797116ad969bbe995b","observation_id":"75ecb9cb-f076-4b2a-86fe-a714d4b318db","resolution":{"observed_at":"2026-08-07T00:57:10.908249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/11941439_149","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:10.959001Z","title":null,"venue":null,"work_id":"28395ea8-b410-4928-b10f-875f93dfd3cb","year":2006},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.912099Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:4667bb6776117780dc2a9ee689459579afd100710281912064791dfa842d8660","observation_id":"9426f444-e2dd-4eeb-9a11-66b08b1675ca","resolution":{"observed_at":"2026-08-07T00:57:10.963083Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:10.915097Z","title":"Gomez, ukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.915097Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:7918ecd965590e35dd87d19594a2e99f5aa0c26cc923f90582b8a01ea177574b","observation_id":"0ebd2b94-b99e-498f-8f9c-f19c1620819a","resolution":{"observed_at":"2026-08-07T00:57:10.915097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-07T00:57:10.917840Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.917840Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:9b89c7f1f1449e825a2d89f026df4b647244ba803374e804b4ab291fadf9cecc","observation_id":"b2db46cb-b472-4c53-a9af-9c12381f108c","resolution":{"observed_at":"2026-08-07T00:57:10.917840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13640","last_updated":"2025-03-13T16:16:12Z","snapshot_observed_at":"2026-08-05T16:11:28.254538Z","submitted_at":"2024-10-17T15:09:24Z","title":"Latent Space Chain-of-Embedding Enables Output-free LLM Self-Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13640","snapshot_observed_at":"2026-08-07T00:57:10.920765Z","title":"Wong, and Rui Wang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.920765Z"},"links":{"cited_paper":"/paper/2410.13640","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:cd9eb3ec93faae7855764c021f39eefa8c3ab1fa8edcd40f72587bd9a4417833","observation_id":"e9a8494b-d2f9-47f1-aa87-7a6f86346bc7","resolution":{"observed_at":"2026-08-07T00:57:10.920765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:11.291632Z","title":null,"venue":null,"work_id":"4d0e639e-223c-431a-953a-779d300e4cca","year":1952},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.923723Z"},"links":{"citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:3e3927f98003e612f258f6ea215a506008557c51afb270ff6d7897b6aa31782f","observation_id":"0a388d33-2556-4b29-bc0e-f8fd39ff955e","resolution":{"observed_at":"2026-08-07T00:57:11.295020Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11674","last_updated":"2024-02-06T08:03:27Z","snapshot_observed_at":"2026-07-06T16:21:33.523806Z","submitted_at":"2023-09-20T22:53:15Z","title":"A Paradigm Shift in Machine Translation: Boosting Translation Performance of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11674","snapshot_observed_at":"2026-08-07T00:57:10.926390Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.926390Z"},"links":{"cited_paper":"/paper/2309.11674","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:57d198ab0cff017cd8971eb6ab327b67df817085bcc855e8e435fc6f46b4e08e","observation_id":"7262afd5-a0b6-4607-a037-09c8a69a14d0","resolution":{"observed_at":"2026-08-07T00:57:10.926390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-07-06T18:07:10.639325Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-07T00:57:10.929888Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.929888Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:10f74e8a364ab8051c4d8f7e48239021c2d7d47e20aa8d9f535d23b27f00752e","observation_id":"5349fefa-a554-421c-82ef-0da9cf739b54","resolution":{"observed_at":"2026-08-07T00:57:10.929888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06215","last_updated":"2025-02-10T07:33:49Z","snapshot_observed_at":"2026-07-06T20:33:48.242475Z","submitted_at":"2025-02-10T07:33:49Z","title":"LessLeak-Bench: A First Investigation of Data Leakage in LLMs Across 83 Software Engineering Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06215","snapshot_observed_at":"2026-08-07T00:57:10.932988Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.932988Z"},"links":{"cited_paper":"/paper/2502.06215","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:706a172e0000bffce61c353ab44eb800141bd2bb58d3b7c17f49257e7b7caa1a","observation_id":"8c4f554b-11c9-4c03-88a8-301010ae9143","resolution":{"observed_at":"2026-08-07T00:57:10.932988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T00:49:11.630639Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":32,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2506.12376."}