{"as_of":"2026-08-12T14:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c49b7199053060fc4d655712260a34b9d1f7812dc45d424559ae6845b15554ee","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T12:43:45.354815Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:21:45.017840Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T08:19:52.876928Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.02289","last_updated":"2025-02-04T12:58:19Z","snapshot_observed_at":"2026-08-12T02:56:43.733303Z","submitted_at":"2025-02-04T12:58:19Z","title":"Evalita-LLM: Benchmarking Large Language Models on Italian","version":1},"cited_work":{"arxiv_id":"2502.02289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02289","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evalita-llm: Benchmarking large language models on italian","venue":null,"work_id":"e533f007-3485-45b5-9d14-0ec98638342f","year":2025},"citing_paper":{"arxiv_id":"2605.07731","last_updated":"2026-05-20T09:02:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T13:36:24Z","title":"Benchmarking EngGPT2-16B-A3B against Comparable Italian and International Open-source LLMs","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-11T03:40:04.692279Z"},"links":{"cited_paper":"/paper/2502.02289","citing_paper":"/paper/2605.07731"},"observation_digest":"sha256:1770e64200199d9298ad6e74965606c6a223bdaebfa526dfde3585707eeac65a","observation_id":"a7adaa20-c0dc-4b4e-aa30-f04429f2e38f","resolution":{"observed_at":"2026-05-11T03:40:53.515641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02289","last_updated":"2025-02-04T12:58:19Z","snapshot_observed_at":"2026-08-12T02:56:43.733303Z","submitted_at":"2025-02-04T12:58:19Z","title":"Evalita-LLM: Benchmarking Large Language Models on Italian","version":1},"cited_work":{"arxiv_id":"2502.02289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02289","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evalita-llm: Benchmarking large language models on italian","venue":null,"work_id":"e533f007-3485-45b5-9d14-0ec98638342f","year":2025},"citing_paper":{"arxiv_id":"2605.07731","last_updated":"2026-05-20T09:02:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T13:36:24Z","title":"Benchmarking EngGPT2-16B-A3B against Comparable Italian and International Open-source LLMs","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-21T08:14:55.858466Z"},"links":{"cited_paper":"/paper/2502.02289","citing_paper":"/paper/2605.07731"},"observation_digest":"sha256:4b03a3ff6abcac6ee616cb5741cd801f26dbcf75af223917dfe6694c312029e8","observation_id":"c98e34a3-206b-42d1-962d-74163b7c14d3","resolution":{"observed_at":"2026-05-21T08:19:52.878692Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02289","last_updated":"2025-02-04T12:58:19Z","snapshot_observed_at":"2026-08-12T02:56:43.733303Z","submitted_at":"2025-02-04T12:58:19Z","title":"Evalita-LLM: Benchmarking Large Language Models on Italian","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02289","snapshot_observed_at":"2026-08-06T19:21:45.017840Z","title":"Magnini, R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04670","last_updated":"2026-08-05T10:28:51Z","snapshot_observed_at":"2026-08-09T20:52:08.263556Z","submitted_at":"2026-08-05T10:28:51Z","title":"Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.017840Z"},"links":{"cited_paper":"/paper/2502.02289","citing_paper":"/paper/2608.04670"},"observation_digest":"sha256:ca8f6fa40d74cdee543c03b5b6a9899487c5725cd890f7847cd6dca0f16cac56","observation_id":"50242c54-3c37-4d0a-8311-5e6ccd0e23b5","resolution":{"observed_at":"2026-08-06T19:21:45.017840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.02289/citation-record","integrity":"/paper/2502.02289/integrity","json":"/paper/2502.02289/citation-record.json","paper":"/paper/2502.02289"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:43:45.596669Z","title":null,"venue":null,"work_id":"495e3b51-a68e-4b40-ad68-a000f85a95b8","year":2024},"citing_paper":{"arxiv_id":"2502.02289","last_updated":"2025-02-04T12:58:19Z","snapshot_observed_at":"2026-08-12T02:56:43.733303Z","submitted_at":"2025-02-04T12:58:19Z","title":"Evalita-LLM: Benchmarking Large Language Models on Italian","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T12:43:45.280100Z"},"links":{"citing_paper":"/paper/2502.02289"},"observation_digest":"sha256:23fea4bdd9a3b483feaf79315332bf7b9ca51aabdc7c2c2d742ee45a692f91e5","observation_id":"abf912cf-0ee2-4d2c-9b4b-ec3b2f5fe5ff","resolution":{"observed_at":"2026-08-09T12:43:45.599975Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:43:45.586683Z","title":"In: Proceedings of the Tenth Italian Conference on Computational Linguistics (CLiC-it 2024) (2024)","venue":null,"work_id":"a3997961-00e3-4028-b07c-2612550850d1","year":2024},"citing_paper":{"arxiv_id":"2502.02289","last_updated":"2025-02-04T12:58:19Z","snapshot_observed_at":"2026-08-12T02:56:43.733303Z","submitted_at":"2025-02-04T12:58:19Z","title":"Evalita-LLM: Benchmarking Large Language Models on Italian","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T12:43:45.284235Z"},"links":{"citing_paper":"/paper/2502.02289"},"observation_digest":"sha256:739722cca76527b36b2ab14459c8b772aed1b2df438cec5623be0671c9b49c8e","observation_id":"06f21b7e-8ceb-4120-bece-b841f10558fd","resolution":{"observed_at":"2026-08-09T12:43:45.590296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:43:45.576274Z","title":"Proceedings of the International Conference on Learning Representations (ICLR) (2021)","venue":null,"work_id":"b7822446-59fb-4407-a0e9-2048cf979921","year":2021},"citing_paper":{"arxiv_id":"2502.02289","last_updated":"2025-02-04T12:58:19Z","snapshot_observed_at":"2026-08-12T02:56:43.733303Z","submitted_at":"2025-02-04T12:58:19Z","title":"Evalita-LLM: Benchmarking Large Language Models on Italian","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T12:43:45.287638Z"},"links":{"citing_paper":"/paper/2502.02289"},"observation_digest":"sha256:fed695e2bed1cb7f014633eaa39b21bf5ca5104149c3998f0acffc823ca0e3cb","observation_id":"bbebef4f-9824-4e69-b8ba-1678644bac8d","resolution":{"observed_at":"2026-08-09T12:43:45.580088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:43:45.560309Z","title":": Calamita: Challenge the abilities of language models in italian","venue":null,"work_id":"8002744f-a689-4640-bd42-6676a7d24768","year":2024},"citing_paper":{"arxiv_id":"2502.02289","last_updated":"2025-02-04T12:58:19Z","snapshot_observed_at":"2026-08-12T02:56:43.733303Z","submitted_at":"2025-02-04T12:58:19Z","title":"Evalita-LLM: Benchmarking Large Language Models on Italian","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T12:43:45.291268Z"},"links":{"citing_paper":"/paper/2502.02289"},"observation_digest":"sha256:dc36f43ffa6c0610b5fc4f8827d2d05204d08ce31b620964910c08aa795937d3","observation_id":"c57a7210-cbe3-48b4-9703-e4e04704c413","resolution":{"observed_at":"2026-08-09T12:43:45.566832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14782","last_updated":"2026-05-31T00:04:33Z","snapshot_observed_at":"2026-08-07T18:21:12.072228Z","submitted_at":"2024-05-23T16:50:49Z","title":"Lessons from the Trenches on Reproducible Evaluation of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14782","snapshot_observed_at":"2026-08-09T12:43:45.294991Z","title":"https://arxiv.org/abs/2405.14782","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02289","last_updated":"2025-02-04T12:58:19Z","snapshot_observed_at":"2026-08-12T02:56:43.733303Z","submitted_at":"2025-02-04T12:58:19Z","title":"Evalita-LLM: Benchmarking Large Language Models on Italian","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T12:43:45.294991Z"},"links":{"cited_paper":"/paper/2405.14782","citing_paper":"/paper/2502.02289"},"observation_digest":"sha256:0e3b2fe27c89751437d79e37fd49138773296035f4e47bdb29810f8da8b542f7","observation_id":"cb3fe706-8351-42ce-bf0a-9f3710f5efa7","resolution":{"observed_at":"2026-08-09T12:43:45.294991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:43:45.549671Z","title":"EV ALITA (2023)","venue":null,"work_id":"cf361192-9d05-4eb2-bff0-f97ec31c33b3","year":2023},"citing_paper":{"arxiv_id":"2502.02289","last_updated":"2025-02-04T12:58:19Z","snapshot_observed_at":"2026-08-12T02:56:43.733303Z","submitted_at":"2025-02-04T12:58:19Z","title":"Evalita-LLM: Benchmarking Large Language Models on Italian","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T12:43:45.298802Z"},"links":{"citing_paper":"/paper/2502.02289"},"observation_digest":"sha256:51ac29138388cfb0a48367b00f3bca37d6ec0000338ccf1cc3cab934b1cb2b41","observation_id":"6920c427-e1d6-4133-b7d9-4f9e8be038d1","resolution":{"observed_at":"2026-08-09T12:43:45.553386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:43:45.539698Z","title":"In: Proceedings of EV ALITA 2009 (2009)","venue":null,"work_id":"35fb39a2-44fc-4207-9881-084ff8bdff92","year":2009},"citing_paper":{"arxiv_id":"2502.02289","last_updated":"2025-02-04T12:58:19Z","snapshot_observed_at":"2026-08-12T02:56:43.733303Z","submitted_at":"2025-02-04T12:58:19Z","title":"Evalita-LLM: Benchmarking Large Language Models on Italian","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T12:43:45.302542Z"},"links":{"citing_paper":"/paper/2502.02289"},"observation_digest":"sha256:5207f2c9447ddf857c7bbcd24d46a8a91fd6e86c15c6cebea976cd43b527d446","observation_id":"ead6d0df-8031-4bf2-9e27-aaaff0679a76","resolution":{"observed_at":"2026-08-09T12:43:45.543034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:43:45.530069Z","title":": Overview of the evalita 2016 sentiment polarity classification task","venue":null,"work_id":"beb7b82d-2c14-4651-958a-5ea60dd754b4","year":2016},"citing_paper":{"arxiv_id":"2502.02289","last_updated":"2025-02-04T12:58:19Z","snapshot_observed_at":"2026-08-12T02:56:43.733303Z","submitted_at":"2025-02-04T12:58:19Z","title":"Evalita-LLM: Benchmarking Large Language Models on Italian","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T12:43:45.305966Z"},"links":{"citing_paper":"/paper/2502.02289"},"observation_digest":"sha256:65003f51396d759a6910bb606ad269f5f0053b250948a50e5791934d9981bd13","observation_id":"1347b221-df26-4b53-aa1d-d7a74955ef98","resolution":{"observed_at":"2026-08-09T12:43:45.533865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:43:45.519430Z","title":"In: of the Final Workshop 7 December 2016, Naples, p","venue":null,"work_id":"0645dd4b-876d-4900-8dcc-a70aa7b79518","year":2016},"citing_paper":{"arxiv_id":"2502.02289","last_updated":"2025-02-04T12:58:19Z","snapshot_observed_at":"2026-08-12T02:56:43.733303Z","submitted_at":"2025-02-04T12:58:19Z","title":"Evalita-LLM: Benchmarking Large Language Models on Italian","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T12:43:45.309114Z"},"links":{"citing_paper":"/paper/2502.02289"},"observation_digest":"sha256:65bf877c0171844b302886cdaf48d01e0ce5bcc6fcc9d63791183b7a974395c7","observation_id":"7a7357ae-53f6-4b29-8afd-3a1e8077e144","resolution":{"observed_at":"2026-08-09T12:43:45.523365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:43:45.508251Z","title":"In: CLiC-it (2023)","venue":null,"work_id":"371e6750-fb50-4c69-b5a9-a57c03851b1d","year":2023},"citing_paper":{"arxiv_id":"2502.02289","last_updated":"2025-02-04T12:58:19Z","snapshot_observed_at":"2026-08-12T02:56:43.733303Z","submitted_at":"2025-02-04T12:58:19Z","title":"Evalita-LLM: Benchmarking Large Language Models on Italian","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T12:43:45.312306Z"},"links":{"citing_paper":"/paper/2502.02289"},"observation_digest":"sha256:f00713f24bd1bfeb5a37327162e243cdcedec924f281d2d887a1bdd6ad74874f","observation_id":"0ffd585c-4df3-4aa6-a722-bf6d7c10a5df","resolution":{"observed_at":"2026-08-09T12:43:45.511680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:43:45.498202Z","title":"In: Proceedings of 40 EV ALITA Workshop, 11th Congress of Italian Association for Artificial Intelli- gence, Reggio Emilia, Italy (2009)","venue":null,"work_id":"5c7ec5d1-1cda-4515-b468-550108ceb1fb","year":2009},"citing_paper":{"arxiv_id":"2502.02289","last_updated":"2025-02-04T12:58:19Z","snapshot_observed_at":"2026-08-12T02:56:43.733303Z","submitted_at":"2025-02-04T12:58:19Z","title":"Evalita-LLM: Benchmarking Large Language Models on Italian","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T12:43:45.315607Z"},"links":{"citing_paper":"/paper/2502.02289"},"observation_digest":"sha256:aba3b8d38bc745a5c02ca6b0616730c6b4c8b40c1aa9dc6c22b25b3dc0d97896","observation_id":"fb4d7656-c2c6-4ab2-87e3-db8dfc592642","resolution":{"observed_at":"2026-08-09T12:43:45.501695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:43:45.488344Z","title":": Nermud at evalita 2023: overview of the named-entities recognition on multi-domain documents task","venue":null,"work_id":"76e41cb4-8271-4bed-b90f-30c387476b9f","year":2023},"citing_paper":{"arxiv_id":"2502.02289","last_updated":"2025-02-04T12:58:19Z","snapshot_observed_at":"2026-08-12T02:56:43.733303Z","submitted_at":"2025-02-04T12:58:19Z","title":"Evalita-LLM: Benchmarking Large Language Models on Italian","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T12:43:45.318948Z"},"links":{"citing_paper":"/paper/2502.02289"},"observation_digest":"sha256:b9cea152cc7dd03ba28a28db9268f267c0636925ae943f1a52c633c5216e9c85","observation_id":"8adcf9e7-a95f-4127-8b70-cda3a06b2933","resolution":{"observed_at":"2026-08-09T12:43:45.492061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:43:45.478091Z","title":"EV ALITA (2023)","venue":null,"work_id":"c2672726-efeb-4dde-9ec2-f04227ada7b4","year":2023},"citing_paper":{"arxiv_id":"2502.02289","last_updated":"2025-02-04T12:58:19Z","snapshot_observed_at":"2026-08-12T02:56:43.733303Z","submitted_at":"2025-02-04T12:58:19Z","title":"Evalita-LLM: Benchmarking Large Language Models on Italian","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T12:43:45.322246Z"},"links":{"citing_paper":"/paper/2502.02289"},"observation_digest":"sha256:5b0d0c57e42db182add9d6f4f46ebfcad47576e4b4ebb03a182956cd1957c840","observation_id":"a7881a81-c4b7-485b-8189-222ef4cc21aa","resolution":{"observed_at":"2026-08-09T12:43:45.481568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:43:45.467621Z","title":"Proceedings of the Seventh Italian Conference on Computational Linguistics CLiC-it 2020 (2020)","venue":null,"work_id":"d5b001c5-03cf-440f-a69a-3795185d2785","year":2020},"citing_paper":{"arxiv_id":"2502.02289","last_updated":"2025-02-04T12:58:19Z","snapshot_observed_at":"2026-08-12T02:56:43.733303Z","submitted_at":"2025-02-04T12:58:19Z","title":"Evalita-LLM: Benchmarking Large Language Models on Italian","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T12:43:45.326021Z"},"links":{"citing_paper":"/paper/2502.02289"},"observation_digest":"sha256:ab3de6e0bc251739972a0cf3498922f242ee938170f239445dc9dd7e664a86f0","observation_id":"8e0ef92c-e636-49a7-b7b6-75a5407318dc","resolution":{"observed_at":"2026-08-09T12:43:45.471342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/info13050228","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Information 13(5) (2022) https://doi","venue":"Information","work_id":"270fd095-ce9f-4f7c-8329-53d529b06470","year":2022},"citing_paper":{"arxiv_id":"2502.02289","last_updated":"2025-02-04T12:58:19Z","snapshot_observed_at":"2026-08-12T02:56:43.733303Z","submitted_at":"2025-02-04T12:58:19Z","title":"Evalita-LLM: Benchmarking Large Language Models on Italian","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T12:43:45.329801Z"},"links":{"citing_paper":"/paper/2502.02289"},"observation_digest":"sha256:9b69e6269cc650d250c538324b9e97502c86eec39d21e924defd2ea5ff3766a8","observation_id":"1ddf87fa-6bb8-4879-b433-fb169fd6f789","resolution":{"observed_at":"2026-08-09T12:43:45.391920Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.13586","last_updated":"2021-07-28T18:09:46Z","snapshot_observed_at":"2026-07-06T11:33:25.933445Z","submitted_at":"2021-07-28T18:09:46Z","title":"Pre-train, Prompt, and Predict: A Systematic Survey of Prompting Methods in Natural Language Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.13586","snapshot_observed_at":"2026-08-09T12:43:45.333606Z","title":"https://arxiv.org/abs/2107.13586","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02289","last_updated":"2025-02-04T12:58:19Z","snapshot_observed_at":"2026-08-12T02:56:43.733303Z","submitted_at":"2025-02-04T12:58:19Z","title":"Evalita-LLM: Benchmarking Large Language Models on Italian","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T12:43:45.333606Z"},"links":{"cited_paper":"/paper/2107.13586","citing_paper":"/paper/2502.02289"},"observation_digest":"sha256:e13288bf2a1d5b875deaed07c9a8ceabbdcc8e98d427e9c830253f550b6d5652","observation_id":"0666da02-62d6-47eb-a534-844480b1a6ca","resolution":{"observed_at":"2026-08-09T12:43:45.333606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:43:45.457485Z","title":"In: Toutanova, K., Rumshisky, A., Zettlemoyer, L., Hakkani-Tur, D., Beltagy, I., Bethard, S., Cotterell, R., Chakraborty, T., Zhou, Y","venue":null,"work_id":"f1edab5f-2e41-495d-a7c2-efa24ab77f0d","year":2021},"citing_paper":{"arxiv_id":"2502.02289","last_updated":"2025-02-04T12:58:19Z","snapshot_observed_at":"2026-08-12T02:56:43.733303Z","submitted_at":"2025-02-04T12:58:19Z","title":"Evalita-LLM: Benchmarking Large Language Models on Italian","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T12:43:45.337075Z"},"links":{"citing_paper":"/paper/2502.02289"},"observation_digest":"sha256:74d1ceb3e210799d382d7286e76b75141267eafde70e6c9b746ec6f4ad12b901","observation_id":"ff26a153-3347-4ae6-9a21-ae095f436840","resolution":{"observed_at":"2026-08-09T12:43:45.460943Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12173","last_updated":"2024-12-12T16:04:31Z","snapshot_observed_at":"2026-08-11T17:03:14.990708Z","submitted_at":"2024-12-12T16:04:31Z","title":"A NotSo Simple Way to Beat Simple Bench","version":1},"cited_work":{"arxiv_id":"2412.12173","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.12173","snapshot_observed_at":"2026-08-09T12:43:45.427574Z","title":"A NotSo Simple Way to Beat Simple Bench","venue":"cs.CL","work_id":"f81bc7ce-7914-4277-99a9-270cbb3d8656","year":2024},"citing_paper":{"arxiv_id":"2502.02289","last_updated":"2025-02-04T12:58:19Z","snapshot_observed_at":"2026-08-12T02:56:43.733303Z","submitted_at":"2025-02-04T12:58:19Z","title":"Evalita-LLM: Benchmarking Large Language Models on Italian","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T12:43:45.340196Z"},"links":{"cited_paper":"/paper/2412.12173","citing_paper":"/paper/2502.02289"},"observation_digest":"sha256:51395a37903bc39d69127e853a82903a7098c6a3f1723a971f2b15658f52b615","observation_id":"66da9b07-76a6-4a1d-97b5-e7922a4032a2","resolution":{"observed_at":"2026-08-09T12:43:45.432046Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00595","last_updated":"2024-05-06T10:20:26Z","snapshot_observed_at":"2026-08-08T03:34:29.851490Z","submitted_at":"2023-12-31T22:21:36Z","title":"State of What Art? A Call for Multi-Prompt LLM Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00595","snapshot_observed_at":"2026-08-09T12:43:45.343766Z","title":"https://arxiv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02289","last_updated":"2025-02-04T12:58:19Z","snapshot_observed_at":"2026-08-12T02:56:43.733303Z","submitted_at":"2025-02-04T12:58:19Z","title":"Evalita-LLM: Benchmarking Large Language Models on Italian","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T12:43:45.343766Z"},"links":{"cited_paper":"/paper/2401.00595","citing_paper":"/paper/2502.02289"},"observation_digest":"sha256:6823dcdc90985902846337b83fd4565d8e57492c1f1003c1099d6d3afd8b31e8","observation_id":"ebf17e8a-803a-46f9-9a86-1f73a7e839db","resolution":{"observed_at":"2026-08-09T12:43:45.343766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17202","last_updated":"2024-10-31T03:26:21Z","snapshot_observed_at":"2026-08-08T15:32:08.649600Z","submitted_at":"2024-05-27T14:24:47Z","title":"Efficient multi-prompt evaluation of LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17202","snapshot_observed_at":"2026-08-09T12:43:45.347746Z","title":"https://arxiv.org/abs/2405.17202","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02289","last_updated":"2025-02-04T12:58:19Z","snapshot_observed_at":"2026-08-12T02:56:43.733303Z","submitted_at":"2025-02-04T12:58:19Z","title":"Evalita-LLM: Benchmarking Large Language Models on Italian","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T12:43:45.347746Z"},"links":{"cited_paper":"/paper/2405.17202","citing_paper":"/paper/2502.02289"},"observation_digest":"sha256:f1410dcfce72954f4aaf83f0c214dc722275a34fc39ebe2f4e49f0ee79d9b488","observation_id":"348d50de-ceee-43ed-b366-50d91bf6ddea","resolution":{"observed_at":"2026-08-09T12:43:45.347746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:43:45.351620Z","title":"In: Al-Onaizan, Y., Bansal, M., Chen, Y.-N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02289","last_updated":"2025-02-04T12:58:19Z","snapshot_observed_at":"2026-08-12T02:56:43.733303Z","submitted_at":"2025-02-04T12:58:19Z","title":"Evalita-LLM: Benchmarking Large Language Models on Italian","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T12:43:45.351620Z"},"links":{"citing_paper":"/paper/2502.02289"},"observation_digest":"sha256:c1cbb9fee229925ab602d4e2cce0bf5f8668a910dc0fa946a5fddd55d270efc0","observation_id":"e476783c-281b-4f14-9f18-dc83110409c6","resolution":{"observed_at":"2026-08-09T12:43:45.351620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-09T12:43:45.354815Z","title":"arXiv preprint arXiv:2303.18223 (2023) 42","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02289","last_updated":"2025-02-04T12:58:19Z","snapshot_observed_at":"2026-08-12T02:56:43.733303Z","submitted_at":"2025-02-04T12:58:19Z","title":"Evalita-LLM: Benchmarking Large Language Models on Italian","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T12:43:45.354815Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2502.02289"},"observation_digest":"sha256:60e098d7e7e91c6f2c33cdf81c95181384eb44638d4ceb03a726ba7cabc762db","observation_id":"3d433e1b-b5f9-4e19-85ee-a92506f5868e","resolution":{"observed_at":"2026-08-09T12:43:45.354815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.02289","last_updated":"2025-02-04T12:58:19Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T02:56:43.733303Z","submitted_at":"2025-02-04T12:58:19Z","title":"Evalita-LLM: Benchmarking Large Language Models on Italian"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":7,"verified_exact":1,"verified_fuzzy":12},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 3 inbound Pith citation observations for arXiv:2502.02289."}