Pith. sign in

Paper Citation Record · LEDGER

NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment

As of 28 July 2026, this Paper Citation Record lists 20 of 20 outbound references and 1 inbound Pith citation observation for arXiv:2604.11543.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2604.11543 v1

Coverage vector

measured 20 of 20 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-10T16:20:44.551760Z

measured 21 of 21 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-07-28T06:31:03.373048+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-07-11T19:11:37.739920Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

20 of 20 outbound references displayed

  • verified exact4
  • verified fuzzy15
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation eafd7f3e-a649-47d6-a7bb-8b9ae0975af5 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 1

Resolution
verified exact
local_arxiv, observed 2026-05-11T09:00:59.495696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.

source=pdf_text observed=2026-05-10T16:20:44.551760Z digest=sha256:61ba831a228819e0635d442695c9dc6204f6fea4ca6959c30794feda799af8a1

Observation 549321d4-00f7-49dd-8656-19a035c7dd3d · outbound

This paper cites Reviewer2: Optimizing Review Generation Through Prompt Generation.

NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment Reviewer2: Optimizing Review Generation Through Prompt Generation

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-05-11T09:00:59.510291Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.

source=pdf_text observed=2026-05-10T16:20:44.551760Z digest=sha256:e768bb5686320c8e4b64676ad0e3d545452de2786227c356c3634bcf05af7bb9

Observation b167f2c2-79f3-4de0-998d-0323b8fbeb2e · outbound

This paper cites Qwen3 Technical Report.

NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment Qwen3 Technical Report

Reference 3

Resolution
metadata mismatch
local_arxiv, observed 2026-05-11T09:00:59.506448Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.

source=pdf_text observed=2026-05-10T16:20:44.551760Z digest=sha256:301e68c28d43a9d5c17101f5ac836fe106933c72c30e080e7d4b71103a355b4c

Observation 63383334-3769-4905-a759-e0ccc87bb527 · outbound

This paper cites In this paper, we propose a novel transformer-based architecture that integrates syntactic information into language modeling.

NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment In this paper, we propose a novel transformer-based architecture that integrates syntactic information into language modeling

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T15:51:55.690274Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.

source=pdf_text observed=2026-05-10T16:20:44.551760Z digest=sha256:b075807c117bb7257ad51c5fcb544abbb90ce3856d7191dd9ba3e3b85c43e267

Observation 0eb517ab-6a4a-46ce-8f8f-0580acba526a · outbound

This paper cites an unresolved cited work.

NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment Unresolved cited work

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T15:51:55.698838Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.

source=pdf_text observed=2026-05-10T16:20:44.551760Z digest=sha256:91bccec22cd089d2f16f3ebc09328408313b610abf3b3ffd4b876467cc4084fe

Observation 72de0aff-8759-4edd-aa05-23afe4915516 · outbound

This paper cites new” or “novel.

NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment new” or “novel

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T15:51:55.687412Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.

source=pdf_text observed=2026-05-10T16:20:44.551760Z digest=sha256:9620c63944e79e41079556cd2d08b3dc4a985b32f68cbfe0d0ce88eba1f0a841

Observation 94dd6201-2778-4c0a-8a30-9a7329312a30 · outbound

This paper cites an unresolved cited work.

NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment Unresolved cited work

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T15:51:55.701173Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.

source=pdf_text observed=2026-05-10T16:20:44.551760Z digest=sha256:184026f47b92a3d96095b75ebf782e565886943da66c022686dd6e03a080c13e

Observation c725fa04-ab54-463d-a369-97f581cb76c2 · outbound

This paper cites an unresolved cited work.

NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment Unresolved cited work

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T15:51:55.703886Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.

source=pdf_text observed=2026-05-10T16:20:44.551760Z digest=sha256:b96caefe885f0c34a040986c5789aa0b9a8801e796ab9c2d6b747899f4d5a7f0

Observation 56785e2a-4cf8-4a0d-a3f1-45a313b764a2 · outbound

This paper cites Model Rel.

NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment Model Rel

Reference 9

Resolution
verified exact
arxiv_id, observed 2026-05-11T09:00:59.517496Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.

source=pdf_text observed=2026-05-10T16:20:44.551760Z digest=sha256:207cb186c7be4a8c3167803c46269909a948a9a96cb2e70ebca1b1d32f5452c8

Observation f0a9b020-82c1-478f-bf94-b814151b25fc · outbound

This paper cites an unresolved cited work.

NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment Unresolved cited work

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T15:51:55.691927Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.

source=pdf_text observed=2026-05-10T16:20:44.551760Z digest=sha256:ed9b03ace1e63f07f72706c9e6ed5e6d6809b1f4332a6e8cd61597c94ba87971

Observation 994c9fba-8ee9-488f-98f0-8a0daf603174 · outbound

This paper cites an unresolved cited work.

NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment Unresolved cited work

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T15:51:55.710497Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.

source=pdf_text observed=2026-05-10T16:20:44.551760Z digest=sha256:a74ef113f09176a0d4bbe9c41d97f361268dc13ddfbb95b4e3083cb64b47fee7

Observation ee18ed52-e0c6-4146-8f77-0da3becbcf71 · outbound

This paper cites an unresolved cited work.

NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment Unresolved cited work

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T15:51:55.706728Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.

source=pdf_text observed=2026-05-10T16:20:44.551760Z digest=sha256:f884681fd7efab36141891df7d1506d33e7f3815c9f896a60a83d3ea6fdcec0a

Observation e02ed532-d340-49e3-b8a2-c4f170d9db5d · outbound

This paper cites Positive.

NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment Positive

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T15:51:55.701873Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.

source=pdf_text observed=2026-05-10T16:20:44.551760Z digest=sha256:9457922001f2ef5364e3e7add3927537e44d1c0622914771e6b80a74feb2b823

Observation 5bebbff7-f2a0-4837-b2bc-1bb4089855bc · outbound

This paper cites an unresolved cited work.

NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment Unresolved cited work

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T15:51:55.677264Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.

source=pdf_text observed=2026-05-10T16:20:44.551760Z digest=sha256:24f4f84c7cec1cd9801a3db4be7100d51aa04c8e2053562a8b64cb26b60df6d2

Observation 3198bb5c-e29e-4549-97b8-a4ca65fb4bb7 · outbound

This paper cites Positive.

NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment Positive

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T15:51:55.679943Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.

source=pdf_text observed=2026-05-10T16:20:44.551760Z digest=sha256:740de8d9f28167fc6c278066a78de24d2aeec9d45a560cf629a0cd0ba7c8833f

Observation abca0b71-f0a7-4ed0-a5bd-923c80450c65 · outbound

This paper cites an unresolved cited work.

NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment Unresolved cited work

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T15:51:55.674403Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.

source=pdf_text observed=2026-05-10T16:20:44.551760Z digest=sha256:a1ca01d8d69cc9c6f6c41c1cb30b12e19d10adf96cbed7af3379eea9f6232d5a

Observation 3e3f5e1a-e356-4cf4-8db7-6890c4dc7233 · outbound

This paper cites an unresolved cited work.

NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment Unresolved cited work

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T15:51:55.671690Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.

source=pdf_text observed=2026-05-10T16:20:44.551760Z digest=sha256:071406e63bd3d53d8ae7493c43941c25680bb0e88f3cb28b3274721675b97642

Observation 55b7180e-8425-41f7-9858-936e1378c8f3 · outbound

This paper cites an unresolved cited work.

NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment Unresolved cited work

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T15:51:55.682544Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.

source=pdf_text observed=2026-05-10T16:20:44.551760Z digest=sha256:965e86c1966b342c8a14b0f2158a684389bec6e281b6bd182026e50c8678d33b

Observation ef92de0c-610f-46fe-b46f-03f60cfbc9f7 · outbound

This paper cites an unresolved cited work.

NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment Unresolved cited work

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T15:51:55.685126Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.

source=pdf_text observed=2026-05-10T16:20:44.551760Z digest=sha256:567533f0a82a399894fe2d82a667fb103971e6433e727e2a4b6e4aad131c915a

Observation ec5b6199-75b3-4877-b1da-c98080b75e3d · outbound

This paper cites Discriminative Reasoning for Document-level Relation Extraction.

NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment Discriminative Reasoning for Document-level Relation Extraction

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-11T09:00:59.514014Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.

source=pdf_text observed=2026-05-10T16:20:44.551760Z digest=sha256:5a39e5f7681a8e9293a399e33487bc0ec28131b087c9582475d9e663c7db7c3c

Pith citing papers

Observation 2c66d0b1-a6ba-411f-9315-b777d9679cfd · inbound

ResearchStudio-Idea: An Evidence-Grounded Research-Ideation Skill Suite from ML Conference Outcomes cites this paper.

ResearchStudio-Idea: An Evidence-Grounded Research-Ideation Skill Suite from ML Conference Outcomes NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment

Reference 56

Resolution
unresolved
no resolver link, observed 2026-07-11T19:11:37.739920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T19:11:37.739920Z digest=sha256:70fd721c737f31757a0bfa7054581534e3e85d972db3cd072d8dce10b907fffa