Pith. sign in

Paper Citation Record · LEDGER

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation

As of 8 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2506.01920.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.01920 v1

Coverage vector

measured 23 of 23 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T11:34:51.004940Z

measured 23 of 23 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

23 of 23 outbound references displayed

  • verified exact3
  • verified fuzzy2
  • unresolved18
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 8f7d8dbf-4588-4510-aae3-9d8b16ce6974 · outbound

This paper cites ArabicaQA: A Comprehensive Dataset for Arabic Question Answering.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation ArabicaQA: A Comprehensive Dataset for Arabic Question Answering

Reference 1

Resolution
verified exact
local_arxiv, observed 2026-08-07T11:34:51.384322Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T11:34:49.699170Z digest=sha256:63a5727cd14169c80f1084ba926d60b4bae4d113f9310fb64d47724aca05883c

Observation d17ebd33-56b1-4c43-bffe-2c2ea598c0ed · outbound

This paper cites AraTrust: An Evaluation of Trustworthiness for LLMs in Arabic.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation AraTrust: An Evaluation of Trustworthiness for LLMs in Arabic

Reference 2

Resolution
verified exact
local_arxiv, observed 2026-08-07T11:34:51.295733Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T11:34:49.726917Z digest=sha256:232f75602469b4d72c1016471924e28d2fd382613b0b9a8becdcb012e354b9b1

Observation 7a85c6bf-8121-49e8-8b79-fc5720f1f99a · outbound

This paper cites an unresolved cited work.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation Unresolved cited work

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:49.802082Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:49.802082Z digest=sha256:cbf64b336d51e5528f84b886c3dd482a72bbe750233a731c481712c191616d26

Observation a5bd6df8-e191-4d1c-9331-48aeba50ff24 · outbound

This paper cites ALLaM: Large Language Models for Arabic and English.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation ALLaM: Large Language Models for Arabic and English

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:49.890709Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:49.890709Z digest=sha256:a107274ddfa413bc68a6c750020e322795349ec54d7e59ef50163dc088f35127

Observation cb319d80-6cc7-4ece-818f-8f616ef391c8 · outbound

This paper cites Aya Expanse: Combining Research Breakthroughs for a New Multilingual Frontier.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation Aya Expanse: Combining Research Breakthroughs for a New Multilingual Frontier

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:49.985966Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:49.985966Z digest=sha256:2170a01dfeab4de422845c4582ca8f533b1bb46833e09841c792328242be8861

Observation 50f7f1dd-fe43-4733-8a89-65cec3f12bb1 · outbound

This paper cites an unresolved cited work.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation Unresolved cited work

Reference 6

Resolution
verified exact
doi, observed 2026-08-07T11:34:51.098268Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T11:34:50.069963Z digest=sha256:e524fd1ab321294f3da07e4838f142e87f6f8ee614008bb329257c6cbed0d309

Observation 0820906a-b442-4c1b-96fa-127cc3db3aa2 · outbound

This paper cites Can We Trust AI Benchmarks? An Interdisciplinary Review of Current Issues in AI Evaluation.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation Can We Trust AI Benchmarks? An Interdisciplinary Review of Current Issues in AI Evaluation

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:50.154288Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:50.154288Z digest=sha256:911ed8a812a167177156f7cec96997a79b1418092e5dbc2d69e3e7d4d98f87e4

Observation 855f6657-0bce-4b7c-9f61-b864dec77795 · outbound

This paper cites an unresolved cited work.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation Unresolved cited work

Reference 8

Resolution
unresolved
raw_fallback, observed 2026-08-07T11:34:51.834139Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T11:34:50.239113Z digest=sha256:56973db70e693a7c33dd1439f249ebcf58c913aeb498d692029ffb069a1dde81

Observation 2fde341b-6ecf-44b0-93d8-2c963b5141d1 · outbound

This paper cites Measuring Massive Multitask Language Understanding.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation Measuring Massive Multitask Language Understanding

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:50.332940Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:50.332940Z digest=sha256:63e43243ce307c2555cc8eaf4c46ccba6ac9bd06761ee3f61ac3931ae849e1c9

Observation fd8e2869-78cc-4063-874c-cdfe1402124e · outbound

This paper cites an unresolved cited work.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation Unresolved cited work

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:50.403505Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:50.403505Z digest=sha256:9d9172e92d07131bd8fb521a23ab0ada9fc92aff20dda7204b4f243485e9172d

Observation ace0a10a-b685-44a5-8d4d-b2259fc7dce9 · outbound

This paper cites an unresolved cited work.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation Unresolved cited work

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:50.470442Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:50.470442Z digest=sha256:20f4c1c002159cd2502662104be2935a8e20b6c711b711977459a6186713ade8

Observation 4bc2f5ad-db21-46d8-ab38-cedbfcf43adf · outbound

This paper cites an unresolved cited work.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation Unresolved cited work

Reference 12

Resolution
unresolved
raw_fallback, observed 2026-08-07T11:34:51.734852Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T11:34:50.511383Z digest=sha256:2472fdfec07e5da7ff73256517b5b7097c71150535363f55a50e625e27fe0c54

Observation 11bc0d2f-8310-4f50-906f-2f9c468e9e19 · outbound

This paper cites DeepSeek-V3 Technical Report.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation DeepSeek-V3 Technical Report

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:50.559074Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:50.559074Z digest=sha256:89de568014867a19c89f7f6886e6f24c8566f124917373b306379d85f988511a

Observation 95ec516b-d1f6-4e6a-8f19-ed54f3a30943 · outbound

This paper cites Arid Hasan, Maram Hasanain, Tameem Kabbani, Fahim Dalvi, Shammur Absar Chowdhury, and Firoj Alam.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation Arid Hasan, Maram Hasanain, Tameem Kabbani, Fahim Dalvi, Shammur Absar Chowdhury, and Firoj Alam

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:34:51.634114Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T11:34:50.596991Z digest=sha256:41729adccca056c279140eacfe8537caa1f8e5b8e1cefc769118a2c9cde1a0ba

Observation 511f2e6c-ad49-4129-b0e6-ca653a0abae8 · outbound

This paper cites AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:50.648503Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:50.648503Z digest=sha256:1c80c4bd54d8cc05e05058234eeb9be63af1552a2dc3bb52ad3054e72f06a826

Observation c2f1f7bb-01c7-42a2-a458-7e5cc6e8f851 · outbound

This paper cites Al-Batati, Arwa Alsehibani, Nour Qandos, Omar Elshehy, Mohamed Abdelkader, and Anis Koubaa.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation Al-Batati, Arwa Alsehibani, Nour Qandos, Omar Elshehy, Mohamed Abdelkader, and Anis Koubaa

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:34:51.545735Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T11:34:50.693248Z digest=sha256:2320b4dc6a3c9a8ef39f1eb55855a5bfea86f59cbc946ceea7cb32f215fe34db

Observation 09d78c35-2ec7-4c0c-aa8f-3d143facbab3 · outbound

This paper cites an unresolved cited work.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation Unresolved cited work

Reference 17

Resolution
unresolved
raw_fallback, observed 2026-08-07T11:34:51.471881Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T11:34:50.752337Z digest=sha256:d1f1a95747b124740d4da55231292a1b8c274f73f7bd3782b9afd2ba925729b3

Observation f0f6db6a-3284-4eb0-a59d-da0585b39560 · outbound

This paper cites INCLUDE: Evaluating Multilingual Language Understanding with Regional Knowledge.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation INCLUDE: Evaluating Multilingual Language Understanding with Regional Knowledge

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:50.802917Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:50.802917Z digest=sha256:f86a478488bb24a6fc1bd99e48cef4aae86ebe216cce899981436de4ff29a019

Observation 037462d2-db88-4024-9a5b-01b34de86ba4 · outbound

This paper cites Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:50.844752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:50.844752Z digest=sha256:7df744e245a4d9a657585386075df7234afafb4399e0b34d681890e89343dd80

Observation 5a4dc060-92f1-4ac6-b295-377b85b3c08d · outbound

This paper cites Fanar: An Arabic-Centric Multimodal Generative AI Platform.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation Fanar: An Arabic-Centric Multimodal Generative AI Platform

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:50.894175Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:50.894175Z digest=sha256:9aadeba818f6721a678235f9f721d6e00dc51e19cca8326f8b92e3c160c1075e

Observation 15872eeb-4ca4-4493-98b8-91bfb477cc0c · outbound

This paper cites The Bitter Lesson Learned from 2,000+ Multilingual Benchmarks.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation The Bitter Lesson Learned from 2,000+ Multilingual Benchmarks

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:50.933392Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:50.933392Z digest=sha256:95d0408e23690fcb7917d185e6462412d76b6dcb5e4860790551e7bb00084347

Observation d0ff7317-27c3-4750-a1aa-6784c20fc1b7 · outbound

This paper cites online" 'onlinestring :=.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation online" 'onlinestring :=

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:50.960111Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:50.960111Z digest=sha256:897bbb8e73c2c035178147b3ced53ac8070167a789cde33a79095fdb34b34acc

Observation 0aeb4db4-44d9-4a75-a9af-5b03c0ab2649 · outbound

This paper cites write newline.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation write newline

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:51.004940Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:51.004940Z digest=sha256:b1b46e52f6c3f3fa8ffe2119748b7b9c15ac4741ded45a07471e7674a31150fe

Pith citing papers

No inbound Pith citation observations are available.