Pith. sign in

Paper Citation Record · LEDGER

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios

As of 21 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 3 inbound Pith citation observations for arXiv:2507.22947.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.22947 v1

Coverage vector

measured 28 of 28 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T17:48:30.750153Z

measured 31 of 31 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-21T06:32:19.484+00:00

measured 3 of 3 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-11T15:23:33.812239Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-06-29T08:33:14.731552Z

Reference resolution

28 of 28 outbound references displayed

  • verified exact0
  • verified fuzzy7
  • unresolved21
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 8ffd47a3-6686-43f5-a00d-46c5633d4e02 · outbound

This paper cites Large Language Models for Education: A Survey and Outlook.

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios Large Language Models for Education: A Survey and Outlook

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-15T17:48:30.500762Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:48:30.500762Z digest=sha256:e026174257815c41ef7b78379f79409ea36e1a020a20ac14035a8cf569074e76

Observation 09a40dff-b931-4f23-847d-a418fc6eaaae · outbound

This paper cites Measuring Massive Multitask Language Understanding.

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios Measuring Massive Multitask Language Understanding

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-15T17:48:30.532529Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:48:30.532529Z digest=sha256:8481e2a10c971e06a4ee9a81ce9c1fc2522ec82bd6ed788c28fd57cdfab3b8dd

Observation 18df8b21-4da3-4181-a5e3-19aaa5b82a2b · outbound

This paper cites Huang, Y.

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios Huang, Y

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:48:31.491196Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-15T17:48:30.537255Z digest=sha256:1238df3c64b49f9fb76cfa69aa5a13783c465b490fb29d6927327f046bb84063

Observation c80aae66-ab23-40cf-ab9b-e1d0036fe0fe · outbound

This paper cites an unresolved cited work.

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios Unresolved cited work

Reference 4

Resolution
unresolved
raw_fallback, observed 2026-08-15T17:48:31.477795Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-15T17:48:30.541849Z digest=sha256:bac688364a90d30728ecaf3346fc967711bc6bdb20830415938016bf8a742a0e

Observation 9400a347-876f-4caa-9c88-4aed7a3a870e · outbound

This paper cites Sarlin, D.

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios Sarlin, D

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:48:31.464294Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-15T17:48:30.546567Z digest=sha256:70223a50f66a4abf71f4af93e5641af7cf53cfd7f8439dda1315b63d99f382fb

Observation 379ad17c-329a-4a9c-affa-c52c5c3d225f · outbound

This paper cites HelloBench: Evaluating Long Text Generation Capabilities of Large Language Models.

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios HelloBench: Evaluating Long Text Generation Capabilities of Large Language Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-15T17:48:30.551579Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:48:30.551579Z digest=sha256:c7190e8399b5dec65fbba9ea79e16731d3043f3bab74de51c939496a0da3746d

Observation a2ad1055-886b-4481-b7b4-66460fc0ab83 · outbound

This paper cites White, S.

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios White, S

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:48:31.451436Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-15T17:48:30.556619Z digest=sha256:36f4f637a1f40cfcb11041749c25444fbd039ff28948ba8a4b4043d8d8e9daf4

Observation 35334b55-5241-40e2-98fa-b5da6bef1bb5 · outbound

This paper cites an unresolved cited work.

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios Unresolved cited work

Reference 8

Resolution
unresolved
raw_fallback, observed 2026-08-15T17:48:31.437213Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-15T17:48:30.561462Z digest=sha256:efc694f1097e52fff212730dba249b52dead34fdacf86d40ed7b260ca7042633

Observation f91dbd25-496c-49e5-9531-2f3247738eba · outbound

This paper cites an unresolved cited work.

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios Unresolved cited work

Reference 9

Resolution
unresolved
raw_fallback, observed 2026-08-15T17:48:31.422716Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-15T17:48:30.565559Z digest=sha256:2acb5d549087f165e47f9e3816ddbb83be5b32e22ef0329cef0790b37615186f

Observation 258eb402-f5e8-4145-a3f7-ff94496fa7f6 · outbound

This paper cites Generating Pedagogically Meaningful Visuals for Math Word Problems: A New Benchmark and Analysis of Text-to-Image Models.

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios Generating Pedagogically Meaningful Visuals for Math Word Problems: A New Benchmark and Analysis of Text-to-Image Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-15T17:48:30.569849Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:48:30.569849Z digest=sha256:094bd096199779aa4a5951ac839af4364ab1126abb9ba02f9db23eee35820393

Observation 0c9b6718-7db1-40b0-b8e3-8ee4ce9737f9 · outbound

This paper cites an unresolved cited work.

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios Unresolved cited work

Reference 11

Resolution
unresolved
raw_fallback, observed 2026-08-15T17:48:31.408155Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-15T17:48:30.574562Z digest=sha256:72854d7a084cd83e5149d5d43fd1533095ece4abf55ef466812101986c071ac1

Observation 53ef9981-031c-4193-8fa9-42e6cdc3f675 · outbound

This paper cites SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines.

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T17:48:30.619494Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:48:30.619494Z digest=sha256:51f25b526534c4b3f1cf10f11d776df1d1981f9a002261a3044ed3f53a4b56bc

Observation 1e7ea847-f8c0-4d24-9b3a-0b6bd2e3f5a5 · outbound

This paper cites Joshi, S.

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios Joshi, S

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:48:31.393419Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-15T17:48:30.682600Z digest=sha256:e278ab4609b0cb03dd8fc740e0d0546bc443af62db99c303bc704a74c5e987e5

Observation e8fb75c3-77c3-425c-96a9-3390dec2ac84 · outbound

This paper cites GPT-4o System Card.

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios GPT-4o System Card

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-15T17:48:30.687162Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:48:30.687162Z digest=sha256:37f9f6ab7b5886907e520c2074ca8929ca3bf976bb6ca93054522eec4ccb7c87

Observation 39d7b9cd-9f8a-481d-b233-fe32a0532297 · outbound

This paper cites Qwen2 Technical Report.

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios Qwen2 Technical Report

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-15T17:48:30.691503Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:48:30.691503Z digest=sha256:f0aba22fcb46d598b95e38b1853ea632fb38ebbf6d228899964157b3730bc44b

Observation 45ad740a-b777-489a-8745-8e72b5adb209 · outbound

This paper cites DeepSeek-V3 Technical Report.

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios DeepSeek-V3 Technical Report

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-15T17:48:30.696212Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:48:30.696212Z digest=sha256:71326608733f377ed1ed2b0330b6905b3a2f490da5f0f4c0481772183138c7a7

Observation 0738cfde-f993-4db7-8f4a-05ea86cfa9b0 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-15T17:48:30.701185Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:48:30.701185Z digest=sha256:f98d454027b63765e254e9051327760a8497658531053847c209881a6610dd05

Observation 2fd030b7-427a-4947-83ae-385f3007f151 · outbound

This paper cites an unresolved cited work.

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios Unresolved cited work

Reference 18

Resolution
unresolved
raw_fallback, observed 2026-08-15T17:48:31.350371Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-15T17:48:30.705552Z digest=sha256:94ca2ed862680e5377c9a2da7759d68db6eb3cacb4e62da90a393598e983b16a

Observation 7237998f-7e4f-4f65-8efe-0def51b12aff · outbound

This paper cites an unresolved cited work.

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios Unresolved cited work

Reference 19

Resolution
unresolved
raw_fallback, observed 2026-08-15T17:48:31.256785Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-15T17:48:30.709650Z digest=sha256:60d96c20ae30bfef7ffb820e99921ff4b8751ed2230a9be0d124dfb9ef07b7ac

Observation bb0b1f53-c179-41e4-a01a-5c531a504e59 · outbound

This paper cites Qwen3 Technical Report.

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios Qwen3 Technical Report

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-15T17:48:30.713818Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:48:30.713818Z digest=sha256:86fe94ecfcc49b449fdb620642d29b2134c7a77e0b3d615b6ddfac2c8b986080

Observation 743f1f17-6509-41ae-8308-5fbc82712e92 · outbound

This paper cites an unresolved cited work.

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios Unresolved cited work

Reference 21

Resolution
unresolved
raw_fallback, observed 2026-08-15T17:48:31.241980Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-15T17:48:30.719319Z digest=sha256:355a84aee0fa1de081d824e8912d2b837b49298359bb8c15f20884c80b303b2c

Observation 735d8ade-4c22-4907-af5f-f50087addb1f · outbound

This paper cites Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities.

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-15T17:48:30.723773Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:48:30.723773Z digest=sha256:4416a391f643cb6ab5a0d69c4136f9c60df099654f747c445a0bc12c6acb8876

Observation 01f08ed5-d25d-45da-bf79-b742311cf0bd · outbound

This paper cites an unresolved cited work.

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios Unresolved cited work

Reference 23

Resolution
unresolved
raw_fallback, observed 2026-08-15T17:48:31.226302Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-15T17:48:30.728508Z digest=sha256:f8327548ea818679ee2b4641429cae33578f37f87789cc1822a761958e74210b

Observation e11f33d7-51e7-4aab-9739-87234c8f32b8 · outbound

This paper cites Appendix A.

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios Appendix A

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:48:31.210281Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-15T17:48:30.732285Z digest=sha256:b0ea7705cf5284f4ae5e2774241b3f9471df8aa365c7f2802cfe7530a3684b57

Observation 0eaba3f7-1f07-47ee-854b-0bf11c1c1990 · outbound

This paper cites an unresolved cited work.

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios Unresolved cited work

Reference 25

Resolution
unresolved
raw_fallback, observed 2026-08-15T17:48:31.194684Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-15T17:48:30.737027Z digest=sha256:83bd6bea660d014d39d4080b74a5974305090841373ce5f1bf05a0f707191094

Observation 5ed96441-9c7c-4081-b725-a78570403768 · outbound

This paper cites Emotional Support Provides guidance, a ffirmation, and emotional support.

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios Emotional Support Provides guidance, a ffirmation, and emotional support

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:48:31.180043Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-15T17:48:30.741196Z digest=sha256:5adf31975de1534fb7ccf52c0a1153d878f9cb3f30a3f4568dc0d9bc7a8ea86e

Observation a066a687-3f3e-4872-87df-aa15207b3ecd · outbound

This paper cites an unresolved cited work.

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios Unresolved cited work

Reference 27

Resolution
unresolved
raw_fallback, observed 2026-08-15T17:48:31.023004Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-15T17:48:30.745821Z digest=sha256:eb86706c9ef4ffd8e0861c1f92a4c50e924562575b5c9bb0e0f39b4d986c84eb

Observation c7a8eaaf-1c21-4beb-8b96-8977176fb00d · outbound

This paper cites Appropriateness of Content Design Uses examples within the cognitive range of pri- mary school students.

ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios Appropriateness of Content Design Uses examples within the cognitive range of pri- mary school students

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T17:48:30.975418Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-15T17:48:30.750153Z digest=sha256:33cf76c44ee04e138ae455091937bf0ca37e14d441af08f6478b6afcdfe073d8

Pith citing papers

Observation 68cc8322-ba67-4332-b14c-412627bb11f5 · inbound

Evaluating Multi-turn Human-AI Interaction cites this paper.

Evaluating Multi-turn Human-AI Interaction ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios

Reference 69

Resolution
verified exact
arxiv_id, observed 2026-05-20T08:33:24.490193Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-05-20T08:33:08.019966Z digest=sha256:61ae7dd2d248b47b9fbe9bff7a07c98e43f27cb029ee17bdc8f91c03b54b5886

Observation 04ba3fe3-9535-4065-907c-0e2d886f373f · inbound

PEARL: Training Socratic Tutors with Pedagogically Aligned Reinforcement Learning cites this paper.

PEARL: Training Socratic Tutors with Pedagogically Aligned Reinforcement Learning ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios

Reference 8

Resolution
metadata mismatch
arxiv_id, observed 2026-06-29T08:33:14.736181Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-29T08:33:08.304252Z digest=sha256:b829274601064757a7c4c723ff890a9945b1e4e96ab0cb346b1367cd9ae3f2c8

Observation b0db8a9e-b6a2-4233-93ef-7f112950c4f2 · inbound

ELBench: A Multi-Dimensional Benchmark for Education-Facing Large Language Models cites this paper.

ELBench: A Multi-Dimensional Benchmark for Education-Facing Large Language Models ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios

Reference 112

Resolution
unresolved
no resolver link, observed 2026-08-11T15:23:33.812239Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T15:23:33.812239Z digest=sha256:274eb8fe5f7955e6ca4957932a4c39bcddef24fd541fed6e40bf0d7826d27fe8