Pith. sign in

Paper Citation Record · LEDGER

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation

As of 8 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2506.01920.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.01920 v1

Coverage vector

measured 23 of 23 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T11:34:51.004940Z

measured 23 of 23 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

23 of 23 outbound references displayed

  • verified exact3
  • verified fuzzy2
  • unresolved18
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 8f7d8dbf-4588-4510-aae3-9d8b16ce6974 · outbound

This paper cites ArabicaQA: A Comprehensive Dataset for Arabic Question Answering.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation ArabicaQA: A Comprehensive Dataset for Arabic Question Answering

Reference 1

Resolution
verified exact
local_arxiv, observed 2026-08-07T11:34:51.384322Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T11:34:49.699170Z digest=sha256:ff5810a9a736815fbf0cf922cc139b87028ddfeae2254db52fcb91ceb406b445

Observation d17ebd33-56b1-4c43-bffe-2c2ea598c0ed · outbound

This paper cites AraTrust: An Evaluation of Trustworthiness for LLMs in Arabic.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation AraTrust: An Evaluation of Trustworthiness for LLMs in Arabic

Reference 2

Resolution
verified exact
local_arxiv, observed 2026-08-07T11:34:51.295733Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T11:34:49.726917Z digest=sha256:8e1a26e791751fd3da47adc5dd4db46af3d27602816a9b45bc5da8e1b6550615

Observation 7a85c6bf-8121-49e8-8b79-fc5720f1f99a · outbound

This paper cites an unresolved cited work.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation Unresolved cited work

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:49.802082Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:49.802082Z digest=sha256:8a82c08a88f8bd854686dafee6c10d4cd840aefc6cf78d9811d4eaa0cfbe7b22

Observation a5bd6df8-e191-4d1c-9331-48aeba50ff24 · outbound

This paper cites ALLaM: Large Language Models for Arabic and English.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation ALLaM: Large Language Models for Arabic and English

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:49.890709Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:49.890709Z digest=sha256:2071d8dff449390423832eea7e84ab86510e8d554038fdff33557d5df3b2f23e

Observation cb319d80-6cc7-4ece-818f-8f616ef391c8 · outbound

This paper cites Aya Expanse: Combining Research Breakthroughs for a New Multilingual Frontier.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation Aya Expanse: Combining Research Breakthroughs for a New Multilingual Frontier

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:49.985966Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:49.985966Z digest=sha256:f71de7650826541c88966b13d480387f03bf686acc99c1545b92d66be07ed55a

Observation 50f7f1dd-fe43-4733-8a89-65cec3f12bb1 · outbound

This paper cites an unresolved cited work.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation Unresolved cited work

Reference 6

Resolution
verified exact
doi, observed 2026-08-07T11:34:51.098268Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T11:34:50.069963Z digest=sha256:4de7f3705b2eb6033c95daf69050cc3f26b5a637a9614f69311e9f6602088c55

Observation 0820906a-b442-4c1b-96fa-127cc3db3aa2 · outbound

This paper cites Can We Trust AI Benchmarks? An Interdisciplinary Review of Current Issues in AI Evaluation.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation Can We Trust AI Benchmarks? An Interdisciplinary Review of Current Issues in AI Evaluation

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:50.154288Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:50.154288Z digest=sha256:f8130614321a5bf8aac341874f741f0a98e2b163b1bf03495ce0cfb3367db306

Observation 855f6657-0bce-4b7c-9f61-b864dec77795 · outbound

This paper cites an unresolved cited work.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation Unresolved cited work

Reference 8

Resolution
unresolved
raw_fallback, observed 2026-08-07T11:34:51.834139Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T11:34:50.239113Z digest=sha256:49798dcfcb5ff94cbe4f0cd007458d092a3748b1255f9d01aed3a1eb8e45313d

Observation 2fde341b-6ecf-44b0-93d8-2c963b5141d1 · outbound

This paper cites Measuring Massive Multitask Language Understanding.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation Measuring Massive Multitask Language Understanding

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:50.332940Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:50.332940Z digest=sha256:09955b2ba5c6b40b6aae5129d1492ef52d5d0b0a572bbf002bebd08a8f22f112

Observation fd8e2869-78cc-4063-874c-cdfe1402124e · outbound

This paper cites an unresolved cited work.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation Unresolved cited work

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:50.403505Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:50.403505Z digest=sha256:9915995b5e3e537e719ee27eaa897997ee4186a88d90d943032ecfcde6f54459

Observation ace0a10a-b685-44a5-8d4d-b2259fc7dce9 · outbound

This paper cites an unresolved cited work.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation Unresolved cited work

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:50.470442Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:50.470442Z digest=sha256:d88b06e4f07b110a14c1a0c7c18c11e4fbec9fc09334ac7d14fff7121be20657

Observation 4bc2f5ad-db21-46d8-ab38-cedbfcf43adf · outbound

This paper cites an unresolved cited work.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation Unresolved cited work

Reference 12

Resolution
unresolved
raw_fallback, observed 2026-08-07T11:34:51.734852Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T11:34:50.511383Z digest=sha256:d192cf710e4dd932b23efb375796da0cbdbbda21667d2a1fa1558a88ab4d88c6

Observation 11bc0d2f-8310-4f50-906f-2f9c468e9e19 · outbound

This paper cites DeepSeek-V3 Technical Report.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation DeepSeek-V3 Technical Report

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:50.559074Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:50.559074Z digest=sha256:c8110770492032213b4f4c49e98120028420dfa984eb030cd46923d71ede0524

Observation 95ec516b-d1f6-4e6a-8f19-ed54f3a30943 · outbound

This paper cites Arid Hasan, Maram Hasanain, Tameem Kabbani, Fahim Dalvi, Shammur Absar Chowdhury, and Firoj Alam.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation Arid Hasan, Maram Hasanain, Tameem Kabbani, Fahim Dalvi, Shammur Absar Chowdhury, and Firoj Alam

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:34:51.634114Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T11:34:50.596991Z digest=sha256:3e98220b1613be5030578c60d95db346f5666f24a8f0c0cd153f91b0e47b73c4

Observation 511f2e6c-ad49-4129-b0e6-ca653a0abae8 · outbound

This paper cites AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:50.648503Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:50.648503Z digest=sha256:e37d3b94f9df730a79616ce934364682bb3969f972147979de1243da66ca206f

Observation c2f1f7bb-01c7-42a2-a458-7e5cc6e8f851 · outbound

This paper cites Al-Batati, Arwa Alsehibani, Nour Qandos, Omar Elshehy, Mohamed Abdelkader, and Anis Koubaa.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation Al-Batati, Arwa Alsehibani, Nour Qandos, Omar Elshehy, Mohamed Abdelkader, and Anis Koubaa

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:34:51.545735Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T11:34:50.693248Z digest=sha256:dab16af6469e0374549a6bc7df56bf98183987b71ae17856c5e41783c1515f2e

Observation 09d78c35-2ec7-4c0c-aa8f-3d143facbab3 · outbound

This paper cites an unresolved cited work.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation Unresolved cited work

Reference 17

Resolution
unresolved
raw_fallback, observed 2026-08-07T11:34:51.471881Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T11:34:50.752337Z digest=sha256:e48f2145dd99c0ba0fb1c8c959b9b3bc79b9e2329fc0ec9f47f4e9bab76f3625

Observation f0f6db6a-3284-4eb0-a59d-da0585b39560 · outbound

This paper cites INCLUDE: Evaluating Multilingual Language Understanding with Regional Knowledge.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation INCLUDE: Evaluating Multilingual Language Understanding with Regional Knowledge

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:50.802917Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:50.802917Z digest=sha256:9a699b5c3908671dda813c53732a080b1de38e3e998b32dd6912d8f90713a665

Observation 037462d2-db88-4024-9a5b-01b34de86ba4 · outbound

This paper cites Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:50.844752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:50.844752Z digest=sha256:8d040fa8b09978251ba73a5579de82e07821031152fa8e0c81120cf55536d61f

Observation 5a4dc060-92f1-4ac6-b295-377b85b3c08d · outbound

This paper cites Fanar: An Arabic-Centric Multimodal Generative AI Platform.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation Fanar: An Arabic-Centric Multimodal Generative AI Platform

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:50.894175Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:50.894175Z digest=sha256:1be527c2946c43c205555895313e90c3113c919ff93cde4c25a052f162102ca7

Observation 15872eeb-4ca4-4493-98b8-91bfb477cc0c · outbound

This paper cites The Bitter Lesson Learned from 2,000+ Multilingual Benchmarks.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation The Bitter Lesson Learned from 2,000+ Multilingual Benchmarks

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:50.933392Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:50.933392Z digest=sha256:1a74cd35b27ea11aabfe727e5e6c68e25ab8a9b8d31c131ab05d3adde188e915

Observation d0ff7317-27c3-4750-a1aa-6784c20fc1b7 · outbound

This paper cites online" 'onlinestring :=.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation online" 'onlinestring :=

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:50.960111Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:50.960111Z digest=sha256:2f1d7e4881f80b72a27b804cf463a0d6681153accd0d85a5cb3caa7cc6d9fb75

Observation 0aeb4db4-44d9-4a75-a9af-5b03c0ab2649 · outbound

This paper cites write newline.

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation write newline

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T11:34:51.004940Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:34:51.004940Z digest=sha256:9285adc416b162975086d53c3c80ac81ca868e2f36dd700a58c7e96f537280cd

Pith citing papers

No inbound Pith citation observations are available.