{"as_of":"2026-08-18T11:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:213f5a44856c0e55d4afad56fa80f63154edf036e4f497c03bb6c84375dcc3db","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:06:59.670819Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.13498/citation-record","integrity":"/paper/2505.13498/integrity","json":"/paper/2505.13498/citation-record.json","paper":"/paper/2505.13498"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:00.177627Z","title":"Evaluating large vision-and-language models on children’s mathematical olympiads,","venue":null,"work_id":"43912b5d-73da-479b-b48c-793de0dbfc8c","year":2024},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.538738Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:0e3d177ab8b65a2418e2b38e587bfb3aa9f6fc992af69026286b4397d8272f3c","observation_id":"e353f138-250f-4b03-9e29-db2994e5ab16","resolution":{"observed_at":"2026-08-15T21:07:00.181948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:00.163991Z","title":"Towards reasoning in large language models: A survey,","venue":null,"work_id":"11d5c490-2603-4bea-8819-a66b16620801","year":2023},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.542424Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:222927934e3e46cc7bc1fa3fff40b1a5cc81d0b27104972af85ee787f18fefb9","observation_id":"3f767a34-2456-4a86-b61b-ddd47f7b6b36","resolution":{"observed_at":"2026-08-15T21:07:00.168449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:00.153168Z","title":"The bitter lesson learned from 2,000+ multilingual benchmarks,","venue":null,"work_id":"642d5748-88ed-4cc9-a4c6-ab19526e6329","year":2025},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.546150Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:2fe6d6ba3596116285bd4bb6cea8b64dfe4af5636ae4ed3273be583ef75902b7","observation_id":"98326dee-95f0-4cfa-af71-1f5066f24ff4","resolution":{"observed_at":"2026-08-15T21:07:00.156588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:00.141470Z","title":"Challenging the boundaries of reasoning: An olympiad-level math benchmark for large language models,","venue":null,"work_id":"4952f54b-99a2-4496-ae41-5f3a9eb0a1ad","year":2025},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.550321Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:80427bd2241672e3f93e1d6e1aaca6c25df6e5dad9b76f8a802a85ecb2c8f1c9","observation_id":"b418d6ba-a19e-419f-8bd9-4012ac3c1c4e","resolution":{"observed_at":"2026-08-15T21:07:00.144957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:00.131072Z","title":"Humanity’s last exam,","venue":null,"work_id":"0253be0d-e0dd-4ca6-961d-324f7c463235","year":2025},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.554166Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:327b1da87acc7ebc3214165d417f55a5479c923c295d6a97aef07134f680f510","observation_id":"9cc1d127-af62-41ed-bdd0-8bb2927c4619","resolution":{"observed_at":"2026-08-15T21:07:00.134305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:00.118528Z","title":"The multilingual mind : A survey of multilingual reasoning in language models,","venue":null,"work_id":"aafc28ff-0db6-4fa5-9292-6ff41fbeae8a","year":2025},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.558077Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:187d24a0b13b1b3e3052d125e7aaefe41d808b32051634fe54ebbb0a93c68295","observation_id":"c8500227-a87f-4036-9a47-50806b63f63d","resolution":{"observed_at":"2026-08-15T21:07:00.122556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:00.103417Z","title":"Scaling test-time compute for low-resource languages: Multilingual reasoning in llms,","venue":null,"work_id":"a2f1aadf-3514-4fda-a4cc-a9aa0957f038","year":2025},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.562226Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:91f5345822771498550e699ede45e15cea294ff4c26986da989be9eb249eb87e","observation_id":"9b1decdb-fb12-4d6c-bf1f-63298839868b","resolution":{"observed_at":"2026-08-15T21:07:00.108586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:00.090856Z","title":"Towards measuring and modeling “culture","venue":null,"work_id":"6f079a36-1429-4e17-af99-170ffee2f396","year":2024},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.565798Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:5fa720591e3070e374aca53199017b88e54bc1828a40823242f5edef1f921f27","observation_id":"7a05bebb-d546-4099-9fa7-09d67df29cd9","resolution":{"observed_at":"2026-08-15T21:07:00.094920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:00.079029Z","title":"Memory of Peoples Series, UNESCO, 3 ed., Feb","venue":null,"work_id":"5e546ef0-6152-438c-ad97-9a3e0e2512d9","year":2010},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.569442Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:7fa21d3fc71365c29e9f621a8aa4290f8a5a2674905d4e95be486d8d6a0df27c","observation_id":"65badd25-f43d-44ce-b1d1-1282e6b31169","resolution":{"observed_at":"2026-08-15T21:07:00.083275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:00.067735Z","title":"SIB- 200: A simple, inclusive, and big evaluation dataset for topic classification in 200+ languages and dialects,","venue":null,"work_id":"bff503a4-efd8-442c-b775-0881a76ed487","year":2024},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.573559Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:2eccef4e1d0d93bdf82701b09174531e657525d14ba18869ef3ad503f0155d19","observation_id":"3e918326-2133-4940-9df9-6cd4de5ec00a","resolution":{"observed_at":"2026-08-15T21:07:00.071489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:00.057235Z","title":"The belebele benchmark: a parallel reading comprehension dataset in 122 language variants,","venue":null,"work_id":"dc74a333-86c2-411b-8afc-8bf2d6014b13","year":2024},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.577410Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:a468e1e9a2fa3c87b13606f4ad9a11264ecb7ff42fb4a3ea2e2e288610302b5a","observation_id":"ff32c060-5313-4954-af16-1751887b485f","resolution":{"observed_at":"2026-08-15T21:07:00.060652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:00.045159Z","title":"Uccix: Irish-excellence large language model,","venue":null,"work_id":"86732155-7392-47ab-ac95-26f93a769019","year":2024},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.581577Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:46d4b0e9c090839a84882803b3844e4f2a13a3db3d877d607090d875f5724638","observation_id":"cb4f1d79-23a6-4346-84b6-706864247b03","resolution":{"observed_at":"2026-08-15T21:07:00.049558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:00.032188Z","title":"Survey of cultural awareness in language models: Text and beyond,","venue":null,"work_id":"eea9032a-585f-4550-a0e3-5b439f887801","year":2024},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.584971Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:13e13b3dbd2e03ea2f272f19f0257b88fcea8a2602de12f348e5d79ff5a1a738","observation_id":"94372199-e63e-4ac2-a3e2-1908b4e85d68","resolution":{"observed_at":"2026-08-15T21:07:00.037295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:00.015363Z","title":"Judging LLM-as-a-judge with MT-bench and chatbot arena,","venue":null,"work_id":"7319cd41-6f71-42a1-8364-d542e7e1084d","year":2023},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.588177Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:5bdcc01b3b1729a143e73cf92461bd65dda23efcd5243eeb4f98e353c8bae540","observation_id":"6b2daa91-c408-4fd6-9906-67f924b15966","resolution":{"observed_at":"2026-08-15T21:07:00.019823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:06:59.998949Z","title":"Justice or prejudice? quantifying biases in LLM-as-a-judge,","venue":null,"work_id":"456ed363-b056-4365-a9bb-9d32d843dbbe","year":2025},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.591265Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:d663f678732af3fe930f0b873b08b93b6123eaff67fae07f1f0f2fbdf42c36b0","observation_id":"d562f72e-d14c-49d4-9065-e1613f418b99","resolution":{"observed_at":"2026-08-15T21:07:00.006224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:06:59.987571Z","title":"Language models are multilingual chain-of-thought reasoners,","venue":null,"work_id":"77c93f68-8bbc-4907-9285-b5a9c6a1e674","year":2023},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.594626Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:92d6fc00e847997e192d046337b2e9597016171032c2b50d68b3ef8f17a09d52","observation_id":"676b34f5-4ec0-4eb7-96d4-3a333addebfa","resolution":{"observed_at":"2026-08-15T21:06:59.991668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:06:59.976779Z","title":"Global mmlu: Understanding and addressing cultural and linguistic biases in multilingual evaluation,","venue":null,"work_id":"0a081afc-3ca7-43cd-9675-950774ff8661","year":2025},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.597963Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:e72f097e631bbada2f6bd49d3bee11c280c363045b485020da52ac0cf52780c9","observation_id":"cb9bcbe7-0ba7-4f67-9fdd-0ae6e6f326f0","resolution":{"observed_at":"2026-08-15T21:06:59.980367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:06:59.965819Z","title":"M3exam: A multilingual, multimodal, multilevel benchmark for examining large language models,","venue":null,"work_id":"b3abaeac-3a66-41f9-856e-44eab81ab991","year":2023},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.601748Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:a17b08332f111246421b41d424093e3447bc5be29a01dea68a1a8e5525d716de","observation_id":"eca2b40d-4bdf-45c5-a489-f3d63625147f","resolution":{"observed_at":"2026-08-15T21:06:59.969920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T21:06:59.604840Z","title":"Training verifiers to solve math word problems,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.604840Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:6ee174cad0553ac635d7ea862e9c3494c3c0b4376b234fa4cb7ba720fecdf12a","observation_id":"9702f91d-7bcc-4094-bdfc-b89415656684","resolution":{"observed_at":"2026-08-15T21:06:59.604840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:06:59.952609Z","title":"Measuring massive multitask language understanding,","venue":null,"work_id":"4ea17ade-4ecf-4b11-bbfd-58c5fefab12b","year":2021},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.608475Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:1b6a195f393164b4d7951345683ad599138bbd67b54029ad62df318fbf48a7af","observation_id":"b938eb7b-4fa9-49b8-85fc-9b9ac3ae1ed1","resolution":{"observed_at":"2026-08-15T21:06:59.956929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:06:59.938868Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese,","venue":null,"work_id":"d7042861-aaab-4f8d-9321-b788f215bb1d","year":2024},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.612067Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:16ced69282c4050a70533c99b6eb0792ad8cffbf2d67516bc6de8476be705367","observation_id":"74846c90-94cf-4c22-a4ad-ccf8b9018d09","resolution":{"observed_at":"2026-08-15T21:06:59.943675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:06:59.926919Z","title":"KMMLU: Measuring massive multitask language understanding in Korean,","venue":null,"work_id":"bedc4811-1bc9-4a8e-aabf-7e89c5ef69f1","year":2025},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.615201Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:e3cb032fb0f4ec930e78bfd43136ec4e993d5ae314d361f897cf0328f8599c51","observation_id":"2ed1a92a-772a-4ea1-9279-315c66d6fad8","resolution":{"observed_at":"2026-08-15T21:06:59.931047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:06:59.912130Z","title":"ArabicMMLU: Assessing massive multitask language understanding in Arabic,","venue":null,"work_id":"dd4577f6-ee42-472b-b7e1-1b97bc418bc4","year":2024},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.618272Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:0db090941ea2ef3648cb43c64704ce6123eec103ad333d1909f70bf7c3a30e16","observation_id":"e80bcadc-f996-4193-8989-e01a5157dcca","resolution":{"observed_at":"2026-08-15T21:06:59.917434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:06:59.898442Z","title":"None of the others: a general technique to distinguish reasoning from memorization in multiple-choice llm evaluation benchmarks,","venue":null,"work_id":"f1fdb066-0cb1-4bfe-835f-3b947edae58e","year":2025},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.621749Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:3c294eab219308584cf5dab32d7e6ede3e1ad5b14eb3a862ce36c5605a446c65","observation_id":"c98c950c-70c1-479d-a39e-e9003b5ae395","resolution":{"observed_at":"2026-08-15T21:06:59.902906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:06:59.885036Z","title":"SPIQA: A dataset for multimodal ques- tion answering on scientific papers,","venue":null,"work_id":"6043a9f0-eab1-4c15-9b60-b74855f20cba","year":2024},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.625246Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:9ad52bd391561d6b7d9553c40743fc3968a781b8d4c343d78d128d6d31ae39fd","observation_id":"8ebe5e9b-80b4-4daa-8e32-3a5ab1817e8a","resolution":{"observed_at":"2026-08-15T21:06:59.889708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:06:59.873325Z","title":"Introducing gemini 2.0: our new ai model for the agentic era,","venue":null,"work_id":"f47135ca-86e6-4ebc-b238-701f3df9dc09","year":2024},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.629230Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:77fdde94007a58d725e8fcb61955b602c33f233800c780179af2660b1a3c53cd","observation_id":"a24f8483-3c3b-40c5-b657-688e93adfc29","resolution":{"observed_at":"2026-08-15T21:06:59.877164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:06:59.858345Z","title":"Gemini 2.0: Flash, flash-lite and pro,","venue":null,"work_id":"c395c3d9-e3a1-41b0-ad0b-c142feed3bec","year":2025},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.633286Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:08c4e25a4cd6b0223c568133ce05e18aff5e90a31a675faa2fddb4aa38fdcc83","observation_id":"4d7baa99-52d9-4371-ae1e-c4f89d245b0c","resolution":{"observed_at":"2026-08-15T21:06:59.863503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:06:59.844789Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":"6e150837-e262-4bc8-91b5-4a45dce59553","year":2002},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.637542Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:67ac508f7fa03166d20c408a1f8ad65b70e2fd2ef5063a4be65b85078bc99923","observation_id":"cc371727-9f41-49ed-a630-d8f3116adfcb","resolution":{"observed_at":"2026-08-15T21:06:59.849362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:06:59.641490Z","title":"ROUGE: A package for automatic evaluation of summaries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.641490Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:670d21c9ad34e9641c6c7840efd7f0f4aba152e177806b84e535a2a61e874ac7","observation_id":"0d321d6a-e496-4656-b662-0f001065d8ff","resolution":{"observed_at":"2026-08-15T21:06:59.641490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:06:59.818413Z","title":"LIMA: Less is more for alignment,","venue":null,"work_id":"b50e1feb-96a5-4e33-b744-ba4045d073ff","year":2023},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.644955Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:a5d6a7a4edfc8bef927245a984487601fc41a7528df15f100e7d9e5fb2c691ed","observation_id":"b22831e4-866f-41ec-9ef3-4e51fefe0a03","resolution":{"observed_at":"2026-08-15T21:06:59.823380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.01759","last_updated":"2016-08-09T17:38:43Z","snapshot_observed_at":"2026-08-16T02:41:53.636308Z","submitted_at":"2016-07-06T19:40:15Z","title":"Bag of Tricks for Efficient Text Classification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.01759","snapshot_observed_at":"2026-08-15T21:06:59.648469Z","title":"Bag of tricks for efficient text classification,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.648469Z"},"links":{"cited_paper":"/paper/1607.01759","citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:197eaa45e5d030e4bb776eeb92ee02cfc7e099cfe4061c247c3b1dc5bbe61d88","observation_id":"2e9c4103-e71e-4883-a8a9-a4efed9b5f14","resolution":{"observed_at":"2026-08-15T21:06:59.648469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03651","last_updated":"2016-12-12T12:51:03Z","snapshot_observed_at":"2026-08-17T13:59:16.192204Z","submitted_at":"2016-12-12T12:51:03Z","title":"FastText.zip: Compressing text classification models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.03651","snapshot_observed_at":"2026-08-15T21:06:59.652350Z","title":"Fasttext.zip: Com- pressing text classification models,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.652350Z"},"links":{"cited_paper":"/paper/1612.03651","citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:c476679ba3809ae22d3e619650e6e4754767888d806313f498953ffa6f59387a","observation_id":"df0fc659-4e43-45cf-8ddb-97d2566cdb01","resolution":{"observed_at":"2026-08-15T21:06:59.652350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:06:59.803854Z","title":"Introducing openai o3 and o4-mini,","venue":null,"work_id":"4c77e2e2-d267-40fc-bd5e-b73c473b5d36","year":2025},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.656580Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:7ec684e6e9cebddd54eb00cac02c2387453fdcdc4d8fce4bc0a45f8fca8c1c6d","observation_id":"568b6873-8f3f-49f3-a5d3-90ef9d205ed8","resolution":{"observed_at":"2026-08-15T21:06:59.808243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:06:59.787722Z","title":"Introducing gpt-4.1 in the api,","venue":null,"work_id":"1cff4127-49a2-440d-86ab-d75242e5a6e4","year":2025},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.660179Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:cb2dd1574f06320e8ac6987a8b28192242e36f9d2252db91af3ce41a1ead8597","observation_id":"9052b625-9441-44f0-80b0-3dd0ed6fdc19","resolution":{"observed_at":"2026-08-15T21:06:59.792246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:06:59.772378Z","title":"The llama 4 herd: The beginning of a new era of natively multimodal ai innovation,","venue":null,"work_id":"c12ac20c-f79d-405f-8540-5989343d1238","year":2025},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.663810Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:1d908f99fff082f35e30decf646c33e815de697fab4da4f818865e20332c1457","observation_id":"820c2407-65b8-493a-bbf0-4fd9e43c1d6d","resolution":{"observed_at":"2026-08-15T21:06:59.777059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:06:59.755069Z","title":"Aya vision: Advancing the frontier of multilingual multimodality,","venue":null,"work_id":"4a3a7f73-ca9f-4b0c-8a79-a24538673991","year":2025},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.667596Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:a655286e3dfc82751f33a774eace0246538dfbd86af01f2c90fe91cab23507bd","observation_id":"3abb851c-3f92-4017-a412-687421e7c253","resolution":{"observed_at":"2026-08-15T21:06:59.759638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:06:59.741625Z","title":"Measuring short-form factuality in large language models,","venue":null,"work_id":"e2bac50f-b863-4bae-84f3-01b2d49be55b","year":2024},"citing_paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T21:06:59.670819Z"},"links":{"citing_paper":"/paper/2505.13498"},"observation_digest":"sha256:4eb06c99f60065ad8dda0fb4f8166140ea956a89ea53bcd8f32a40d7b9b3bf66","observation_id":"9aa5105c-3e93-495d-bb01-9b7076063a37","resolution":{"observed_at":"2026-08-15T21:06:59.746725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.13498","last_updated":"2025-05-16T00:02:05Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T13:59:54.216306Z","submitted_at":"2025-05-16T00:02:05Z","title":"IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2505.13498."}