{"as_of":"2026-08-04T16:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2ae12ada132516ea340e43c4fee51fa3de1fd8000b24609aacca2e89e3864794","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T17:47:11.338622Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.26955/citation-record","integrity":"/paper/2605.26955/integrity","json":"/paper/2605.26955/citation-record.json","paper":"/paper/2605.26955"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"System Card: Claude Haiku 4.5, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:3361ccb5da7c75cec6baa9a8221ff349e82a0b66aafedb2403e9b1638e5e0dc6","observation_id":"a4619eea-3db7-4c6e-9cb8-66efad165434","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"System Card: Claude Opus 4.7, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:c81a39cb6562e220328ba3f4f03aaa0f9cc5b8f8d3a2519df48ecdb434211dbc","observation_id":"09944844-4069-4bfa-9b4d-89488064d0df","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.acl-long.578","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:53:46.592168Z","title":"CaLMQA: Exploring culturally specific long-form question answering across 23 languages","venue":null,"work_id":"5d3455f3-e89e-41e3-b9c3-e5863cc2049c","year":2025},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:e440058578271c5e5faa63fd79a2907a2180744d7bb085c2d18c8bf6d5f52ec0","observation_id":"0a40819c-4b10-453b-a193-53660fb0d71f","resolution":{"observed_at":"2026-06-29T17:53:46.593494Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2318.379051","doi":"10.1145/3772318.3790519","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems , articleno =","venue":null,"work_id":"232793b8-720c-4865-90a1-c1c3589e695b","year":2026},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:aae05bdd88da80ab758399fdf3be5b7ec17ecee92e635880ba03cdc13d95b8f6","observation_id":"06544dfa-c6e1-4069-bcec-d453038ee9a2","resolution":{"observed_at":"2026-06-29T17:53:46.589630Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:50:01.543326+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:50:01.543326+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:47:46.776388Z","title":"Knowledge-Centric Hallucination Detection","venue":null,"work_id":"557a574b-31bd-4f07-9bd0-47bc7c74bcd8","year":2024},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:7a4a8ccd3b03b75d3d2fc8fe75682275f304531883370567e5c31eb63e450897","observation_id":"fc79d55a-41f0-4566-9838-85f3ed56fcf5","resolution":{"observed_at":"2026-06-29T17:53:46.593224Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:47.367793+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:47.367793+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"How people use chatgpt","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:a6ef0bb196c44c7bcca245e2a049a557c8d825b50144cfd1c3143ca155a1128b","observation_id":"e9b3cbb9-c095-46ed-acc5-08cc79c87d52","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.474","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:38:28.372065Z","title":"Humans or LLM s as the Judge? A Study on Judgement Bias","venue":null,"work_id":"15d44b6d-5659-44dd-9508-d9df529b958b","year":2024},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:49cdf4d4672e9d1e2a7686beabf1180ce99030ba2f1884a6079e30570bd04039","observation_id":"60953bf4-2b91-4e56-a1b6-3c7b6c7469da","resolution":{"observed_at":"2026-06-29T17:53:46.582163Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:20.543814+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:20.543814+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.00521","last_updated":"2026-05-29T10:53:54Z","snapshot_observed_at":"2026-08-03T06:08:24.611057Z","submitted_at":"2026-01-31T05:24:08Z","title":"Diagnosing the Reliability of LLM-as-a-Judge via Item Response Theory","version":2},"cited_work":{"arxiv_id":"2602.00521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.00521","snapshot_observed_at":"2026-07-04T00:59:21.211457Z","title":"arXiv preprint arXiv:2602.00521 , year=","venue":"cs.AI","work_id":"531d0772-f3a5-40f2-a21a-f3eb967a28aa","year":2026},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"cited_paper":"/paper/2602.00521","citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:9adfa7055d56a41a5e538154c0f599aafc43713b7f3cb3c2bf71ee64f46b576f","observation_id":"3e873e89-734a-482c-b7fb-6c53756d99c3","resolution":{"observed_at":"2026-06-29T17:53:47.412884Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:93529c3f60ec0dfd6c1eabc439d07f614e0c3bc6e559da223cb9bd95d2cee011","observation_id":"92b1dd5c-3a6e-473f-aa64-13e81f22fc77","resolution":{"observed_at":"2026-06-29T17:53:47.416237Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09369","last_updated":"2024-02-14T18:16:54Z","snapshot_observed_at":"2026-08-01T18:25:19.560373Z","submitted_at":"2024-02-14T18:16:54Z","title":"Massively Multi-Cultural Knowledge Acquisition & LM Benchmarking","version":1},"cited_work":{"arxiv_id":"2402.09369","doi":"10.48550/arxiv.2402.09369","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09369","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Massively multi-cultural knowledge acquisition & lm benchmarking","venue":null,"work_id":"cc608dcc-ca45-49e5-8b98-f03657fa846d","year":2024},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"cited_paper":"/paper/2402.09369","citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:060506fefa7be1087e6ba9668dc2f36b4ed4464880c211ad256ec06ce5a29bac","observation_id":"cb6399c7-fa6c-4847-919e-f7556099c6cd","resolution":{"observed_at":"2026-06-29T17:53:47.410265Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"Thick description: Toward an interpretive theory of culture","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:2b9c682f689d922da3beaaa3b46f608e2891034c44c8e44bee8334b0731ba679","observation_id":"8687a163-8afd-49f5-aa86-c3a6c879ae55","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"Gemini 3 Flash Model Card, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:cbc62fe0d97bcf1fcb9938f88cc66e5b998687e87ad8c65de81875885119f0d6","observation_id":"823a593f-ff98-4dbd-8732-aed124a27aad","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"Gemini 3 Pro Model Card, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:5395e4f5327e0714bdec8374eea8ac33f95afb1adb30446dc0ae01811a5f357a","observation_id":"2fc0f6a9-c570-44a9-83ad-1b5420f6ed19","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"Gemini 3.1 Pro Model Card, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:badc478b483a2e1e9f7c2d781accdd40ca74be5f911abf6f4208057161de1dfa","observation_id":"56933d61-d3d1-4873-94cd-7c2ba7a1ad30","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"Gemma 4 model card, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:0f57b22102bf1d9e2c2f6a1ae643e30ee3f90fb547c1a64bdc50c4bc3010bcc1","observation_id":"da142a95-0c6d-42e2-b5c0-c506d2fdf7d6","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06032","last_updated":"2024-11-09T01:38:55Z","snapshot_observed_at":"2026-07-06T19:47:47.232714Z","submitted_at":"2024-11-09T01:38:55Z","title":"LLM-GLOBE: A Benchmark Evaluating the Cultural Values Embedded in LLM Output","version":1},"cited_work":{"arxiv_id":"2411.06032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.06032","snapshot_observed_at":"2026-06-29T17:53:47.405703Z","title":"emnlp-main.2/","venue":null,"work_id":"1a5183a6-9fa4-4703-84eb-f5ad568f8df3","year":2024},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"cited_paper":"/paper/2411.06032","citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:bd292cc29120aaafaa367fd07aeeb13b4e2f9302ab2beb4236fc72bf42ec4775","observation_id":"dfd8faf6-733b-47eb-8564-fdf20802be7f","resolution":{"observed_at":"2026-06-29T17:53:47.407284Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2026.mme-main.1","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:53:46.599930Z","title":"LLMs as span annotators: A comparative study of LLMs and humans","venue":null,"work_id":"5282fb72-223e-43c0-a302-1ddf62b66091","year":2026},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:8c054c7a8143627cc50eb365e827516717e78b5076e1dc257a1a80313440c0a3","observation_id":"d09e47b2-1b0d-495b-9367-ff5fb176e4da","resolution":{"observed_at":"2026-06-29T17:53:46.601330Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:844fcd1bfec20aa47a278a1b869e7678301915d01c69f42bde234bc14b5bd7b2","observation_id":"bb1938be-67d7-4650-a846-46939ff4bd65","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.emnlp-main.138","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:48:32.225027Z","title":"From generation to judgment: Opportunities and challenges of LLM-as-a-judge","venue":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing","work_id":"d1491133-c760-4410-a6df-a93780897bef","year":2025},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:86caf59c7de5b4526332d79746e32c16fc5f4e29d832a98b480ab179bbd16189","observation_id":"87972cc3-bde9-4d4d-a531-1df4d88dfab2","resolution":{"observed_at":"2026-06-29T17:53:46.595471Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:92fe5edcec0faf0a3ceb3c535ea5037cd0aeb1c1c0cc6ee1697494dd07af2b75","observation_id":"2eecfd6a-652e-4520-9cf8-69f04e6243e6","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"Accessed: 2026-05-06","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:3bc983b0cc84acc98872a35442c4b4e7aca202c49e85ee254f1457d82163b7ba","observation_id":"2e0d077c-86f3-4d82-b806-ec23feb66ba6","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"Blend: A benchmark for llms on every- day knowledge in diverse cultures and languages","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:0168c782ad64a4f5e676dac8a9da0592aff4421503760906b8e29aea90383d3b","observation_id":"7875d8f1-4fd4-43a2-8cd0-502f0e419535","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"Having beer after prayer? mea- suring cultural bias in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:6ac72c3329bca50ae7bd3a817f12442d62a8dee3f936bb036fbafb1bb046a707","observation_id":"a51ca0c8-0833-47bb-8be9-81bac77a46e0","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.862","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T13:16:57.868570Z","title":"Having Beer after Prayer? Measuring Cultural Bias in Large Language Models","venue":null,"work_id":"a16e1c7e-f6c3-4768-873d-7ef8a61f24ab","year":2024},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:f6a99326c73308b94d53dcd2de32602518c8acf089728fb31474d0d4fb76f61f","observation_id":"d87269c6-69f2-44ce-a58c-d46590d35566","resolution":{"observed_at":"2026-06-29T17:53:46.599384Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T09:08:04.650779+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T09:08:04.650779+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T11:37:03.093376Z","title":"In: Christodoulopoulos, C., Chakraborty, T., Rose, C., Peng, V","venue":null,"work_id":"e6d6ecae-3575-45e2-8c99-76359a926a1a","year":2025},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:577f4bb053f78d9a1ee889429d63973006e0128d9f5bdef126195566e0a4b991","observation_id":"9542a2ac-8ac6-4e46-adfe-c8f50a5f7c88","resolution":{"observed_at":"2026-06-29T17:53:46.588647Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:08:10.343755+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:08:10.343755+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"GPT-5.1 Instant and GPT-5.1 Thinking System Card Addendum, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:3f45d04e186c51293b9d1ae982f2b79811fd5d2b09fb1414682ece59bf9121b0","observation_id":"3d42089f-8941-43e2-9a33-ccf9af695491","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"Introducing GPT -5.4 mini and nano, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:ec8822b14899d4f80352f186d26ab5f2b1cb0efec51992331aad836c0ef5ad4b","observation_id":"4a7c4567-2585-4d63-9e7b-669ed0d677cf","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"GPT-5.5 System Card, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:0fd41cd1c98ed32f31eb59a8c3b494a430b289559da94926b03593bdce01a248","observation_id":"c9e01772-e4f8-4a89-ad14-224034195cf2","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-01T16:27:35.664983Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":"2508.10925","doi":"10.3115/1073083.1073135","metadata_source":"pith","pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","venue":"cs.CL","work_id":"178c1f7e-4f19-4392-a45d-45a6dfa88ead","year":2025},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:96de5556e0fc54f72cab144897e9963937b60bb5b1e4020371e0481bc8e9b51a","observation_id":"1394af87-4e52-4154-a1e2-9cd7b06855f0","resolution":{"observed_at":"2026-06-29T17:53:47.399537Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T19:19:47.962081+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T19:19:47.962081+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"Survey of cultural awareness in language models: Text and beyond.Computational Linguistics, 51(3):907–1004, September","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:5411b0f7da6318d8cb9b2be9bae688046eeda8ac854b2dacaf6f906127ddc515","observation_id":"a3b50e3b-6b03-4232-a2cf-ab084bba021f","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/coli.a.14","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:53:46.578806Z","title":"URLhttps://aclanthology.org/2025.cl-3.7/","venue":null,"work_id":"12bb8cce-2f87-477c-85e5-5efdbd492a86","year":2025},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:e5778405669b2402a7e5d0e0d7181928307e55592d39e3515a6ff4423f98d9ac","observation_id":"868defe5-53da-4cdc-8ab3-72e18d02949b","resolution":{"observed_at":"2026-06-29T17:53:46.580070Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aies.v8i3.36696","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:53:46.601924Z","title":"thick evaluations","venue":null,"work_id":"c2f8d9a4-7b12-4941-843d-1897b869b619","year":2067},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:cb967712711b25fec6caa9ab813249a82847c0fbc4836ab9a945300456cd0507","observation_id":"3c928154-e474-425f-a209-834ca98d1dc2","resolution":{"observed_at":"2026-06-29T17:53:46.603685Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.findings-acl.1049","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:53:46.593891Z","title":"Localizing and mitigating errors in long-form question answering","venue":null,"work_id":"275df1ac-fbd2-40c4-b238-f2b6da472341","year":2025},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:d0035aab3d6aa2458867c9d7edd0006af70b211d7da7db726ac59a157f1cc510","observation_id":"00c60c5e-8280-416c-898c-21ce2bd5ef2d","resolution":{"observed_at":"2026-06-29T17:53:46.595178Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-emnlp.288","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T17:34:56.867649Z","title":"C ulture B ank: An Online Community-Driven Knowledge Base Towards Culturally Aware Language Technologies","venue":null,"work_id":"9f76b21a-472b-436a-bdd5-c5750cef2d6b","year":2024},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:1330740dc0d261de35f688db70c392840efe6d116afe9a8666a467f38ba0b616","observation_id":"39c2e6f2-8883-4d33-af02-1cb899aa03b3","resolution":{"observed_at":"2026-06-29T17:53:46.576095Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T12:23:10.67466+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T12:23:10.67466+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":"2601.03267","doi":"10.48550/arxiv.2601.03267","metadata_source":"pith","pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-07-11T02:17:46.480513Z","title":"OpenAI GPT-5 System Card","venue":"cs.CL","work_id":"ca87689a-0d29-4476-b504-b65dbbb08af4","year":2025},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:60ade4b043d993d8cdf4016fe0a922886ab12e215893a16aef7a306b774d4cd5","observation_id":"342599ab-95bf-4db7-bb7f-66e7b1a970ee","resolution":{"observed_at":"2026-06-29T17:53:47.401833Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-03T00:38:11.458508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T00:38:11.458508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17578","last_updated":"2025-03-29T11:50:10Z","snapshot_observed_at":"2026-07-06T19:38:13.816410Z","submitted_at":"2024-10-23T06:04:55Z","title":"MM-Eval: A Multilingual Meta-Evaluation Benchmark for LLM-as-a-Judge and Reward Models","version":2},"cited_work":{"arxiv_id":"2410.17578","doi":"10.48550/arxiv.2410.17578","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.17578","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"MM-Eval : A multilingual meta-evaluation benchmark for LLM -as-a-judge and reward models","venue":null,"work_id":"5a59decf-f084-416a-9daa-7fe3a237bc21","year":2024},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"cited_paper":"/paper/2410.17578","citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:3e97cfcaa2193da455531e78e631c2dc35b2f00a57925a4767f71f96518bd2f8","observation_id":"5eee0f55-d720-4fea-b851-e1af78d24fd6","resolution":{"observed_at":"2026-06-29T17:53:47.404546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-emnlp.552","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:53:46.598004Z","title":"doi: 10.18653/v1/2024.findings-emnlp.552","venue":null,"work_id":"ef5b357e-4674-464a-a059-24132b315505","year":2024},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:90386c80e4c16e5d93bce16e701dd09031071bdc0c9a4b94489fb9816b947c7f","observation_id":"ba0a2b5a-8483-4b7b-81f4-f57ccf47bc4c","resolution":{"observed_at":"2026-06-29T17:53:46.599555Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T21:20:15.023285+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T21:20:15.023285+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"Judgebench: A benchmark for evaluating LLM-based judges","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:0722840be9d52214429cf07a2f16077da22ec67863a717e75ffc729c53baa726","observation_id":"c38fe32f-fd56-41d4-829f-53fa67ec7600","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.12014","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:53:47.394977Z","title":"Cure: Cultural understanding and reasoning evaluation - a framework for \"thick\" culture alignment evaluation in llms, 2025","venue":null,"work_id":"46fc520a-4dc8-4cd8-bbfd-0c20d675ba60","year":2025},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:df5fe000ae863ba19c1b38420b3cfc9d28c122deeb52400e89cb9a0d649e1312","observation_id":"10ffa468-3d00-417d-a16c-9b22d5fda495","resolution":{"observed_at":"2026-06-29T17:53:47.396624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:fe881261e14f536556b197eccf8bb0d5ec647d55245bca82b8b7d62f0ebbf60d","observation_id":"288747a9-1a83-4f51-84de-bbf58bba0e8d","resolution":{"observed_at":"2026-06-29T17:53:47.418969Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.findings-emnlp.1256","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:53:46.585464Z","title":"Hedderich","venue":null,"work_id":"f7747f29-9f0d-4464-afb2-a64582e54f21","year":2025},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:9d5d421685ce70e7a49d76b3fd3ede47b271a7170cf7d9001d5002d2490e70eb","observation_id":"44992b7e-d786-42db-a60e-10e1dea9fe65","resolution":{"observed_at":"2026-06-29T17:53:46.586802Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:9db5168af73d00734702cd06ace2cef044f19783a4eae8ab30458d3eac3c022c","observation_id":"6668b4cb-1608-4641-a520-a79f5b947ed9","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.acl-long","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T00:04:22.268055Z","title":"ISBN 979-8-89176-251-0","venue":null,"work_id":"2600ef32-de86-4edc-bcf2-b00fcc304cf8","year":2025},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:47b43722650f11d76036224dbee8904722efce232ab8caa32c63393e4a64bb14","observation_id":"5d62ea6a-7346-437c-b896-1037d82bbe8a","resolution":{"observed_at":"2026-06-29T17:53:46.597559Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-03T00:38:21.28382+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T00:38:21.28382+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"fresh soy milk (kacang kedelai)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:b1eea4a76e9b51ca0fc5d1053b6c0875f0f0308a420b52ceee655f17676731cc","observation_id":"9b7bb17e-3117-4d45-9dec-f7beb7a6c7de","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"Rewrite the explanation to clearly convey their rationale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:eefd330e63698f1c462691c7fb1dc03871d840e6c8702963aa92abded490988f","observation_id":"da30f39e-24a2-4a38-bb98-374c54c8157c","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"Validator Comment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:6140661616da61151b20aa446ba6e656c7f11b7ed4f50ad84502106c2ff8b03b","observation_id":"82daa28e-e76d-423e-9f29-ba6da7f07021","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"Suggested Correction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:e23ead0d38733a4eb976b073c6a8f906c271ad37799f6bfeceba69f10699d48a","observation_id":"e1b3ea3f-94cd-4ba2-b830-a000802a0fa9","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"LLM Response","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:82af22f6ab15734a08de7dc2a5ae16777218d39f0783eb3a58b6bf73c2c23404","observation_id":"59ac089f-0e02-45a4-aaf7-d70f189b9dfb","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"Validator Comment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:8c827166778c47c3d7cbc145ba87ef15596a85d7fd7bbdab32c2ae8d0afb5186","observation_id":"d43761c8-30a2-4735-9e93-0d984f4ec109","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"You may also use code-switched text where English acts as the matrix (base) language, embedding specific expressions, words, or idioms from the original language of the text","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:b4b1bc21af2f1dc48535ddc0e3e18f646ba306b54b85a751902433d0f0348797","observation_id":"f0bde085-7314-4039-a05b-878e09c714cf","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"Validator Comment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:df2379cbf13ea080c422adb64fd0cba7ce46807b32a95416ce174b87b18cb51f","observation_id":"5807551f-6cdb-4fef-8c8e-819a5647c2dc","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:d8db14ac0cbcc0a0dec1a4a73846e13f8c02bd10ff1b403e25d8994f07fe8d67","observation_id":"b03d5283-e0aa-47aa-88a3-4a865b3f13aa","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:d33afbeeba32e1a499a267d898cb6e01882ba4f5c31c154e19a6a86db5654223","observation_id":"243da317-d5ce-4e55-84b5-4b693a888d2e","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"Guidelines:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:83253707e538896da50783c9e5c5e7188cf08747e087d9573a2cbed1f625e889","observation_id":"93033d76-dd19-4089-a231-34aa4808a2b0","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"- The text spans do not need to be perfectly identical","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:7b559165a0d7e4da3faa6765fff68729293a4bc704924625123ce048cd711c35","observation_id":"10b18940-125c-4e70-b275-ec6da9bf5a8a","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"{span_a}","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:89dc42b6726519d704483125d56947be4419ffbf7f1125c86c403f009a22e5a4","observation_id":"b3d864ba-101f-4b85-89a1-542375f93513","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"error_type","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:365eeb0dc2f2f1fc14f562734d7bbc8d6a426e875c0ae7ee25a18c314a9fab00","observation_id":"4f531cc1-9187-46ba-b104-4357d84fa974","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"error_type","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:ef76e1bedd005636e13c481e5e689c9ba3f4c25265caa29e57d538a933f32762","observation_id":"5a42f340-6b2d-400b-8d8b-5150a9f6027e","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"error_type","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:553b588a570b44951e956f3e05e6e0f82d45307b0701f3ff147dc8da2b9588a5","observation_id":"6fad9ce4-62c8-4d74-b0ff-12e7f368c6fd","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:66ec91fc78d86ff12821ed7228e1ba8685e4dd666c6887d4f201eb070ce0e114","observation_id":"2ac0150e-f117-490d-84e9-a40436dbf52e","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:231f239546c0a6141e4a97dbea9ed403d85fe7790c8706a91f25a0be4f2af4b1","observation_id":"c5215c34-ea2b-4cc3-8c47-5cf23572d431","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"error_type","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:7379cab62f8e4b07400585ed05582733a43f252a5b7fd72cfa0da6fee158d303","observation_id":"919c0f68-7587-454a-bed6-77b25c74b85f","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:47:11.338622Z","title":"same/different","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:55af8707f262e6df3d99eaba7bdf3d9fe63366d1077d9df71ff93cc52a08d05d","observation_id":"fa062876-347a-479a-8b35-ab9bee7f4edd","resolution":{"observed_at":"2026-06-29T17:47:11.338622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5070.5253","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:53:47.392460Z","title":null,"venue":null,"work_id":"1f231cad-32d5-45ce-ad93-9f8d891440a4","year":2082},"citing_paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-29T17:47:11.338622Z"},"links":{"citing_paper":"/paper/2605.26955"},"observation_digest":"sha256:51b27d718e8dee93770df97351751a683df2324c62da48a2de52b335a55c539b","observation_id":"5658ce11-e77a-4a93-b119-c3353881f541","resolution":{"observed_at":"2026-06-29T17:53:47.393828Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.26955","last_updated":"2026-05-26T12:45:21Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T23:36:43.912215Z","submitted_at":"2026-05-26T12:45:21Z","title":"JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":2,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":37,"verified_exact":20,"verified_fuzzy":0},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2605.26955."}