Pith. sign in

Paper Citation Record · LEDGER

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models

As of 8 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 1 inbound Pith citation observation for arXiv:2506.11110.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.11110 v1

Coverage vector

measured 27 of 27 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T05:48:18.762671Z

measured 28 of 28 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-19T17:49:01.198956Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-19T17:52:43.078608Z

Reference resolution

27 of 27 outbound references displayed

  • verified exact1
  • verified fuzzy4
  • unresolved22
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation ca8b12ba-acf4-4680-97e9-4b44f66a4dde · outbound

This paper cites an unresolved cited work.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Unresolved cited work

Reference 1

Resolution
unresolved
raw_fallback, observed 2026-08-07T05:48:19.145616Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:48:18.674740Z digest=sha256:cf13fd20811b5294452ef07d0ef7d0a42a49a14504a3e58bc53efc6d912a89cf

Observation a8801b79-71de-4efb-8102-d2978f32e8e6 · outbound

This paper cites On the Opportunities and Risks of Foundation Models.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models On the Opportunities and Risks of Foundation Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.679496Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.679496Z digest=sha256:c3461ad71c6c31d99923f6be993e5478c8a0227c3beb94ab29d6333d320b8a1a

Observation ecb9b38d-20a2-44e3-bcb3-9c35e283c271 · outbound

This paper cites an unresolved cited work.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Unresolved cited work

Reference 3

Resolution
unresolved
raw_fallback, observed 2026-08-07T05:48:19.136887Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:48:18.683603Z digest=sha256:ee69174e8be1890dc7c72916cb4fde2580d9374d448c70ed455d0271787ba1f1

Observation 22e083f8-5051-4f3b-aa9e-db05d3809bee · outbound

This paper cites Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.687477Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.687477Z digest=sha256:ca870695d0e8602a1134a175b74d61c6611d5fe84d7a572024a1c5939b793691

Observation 6b2f8c53-b099-458e-a10e-bf6182cea7cb · outbound

This paper cites N., Agarwal, A.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models N., Agarwal, A

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.691190Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.691190Z digest=sha256:ab79cc8b3715d108b623f8875241d6d38459fa6df94ffa69bb38e3d98a5923d1

Observation db6f8624-e4bd-4c88-9df9-582ee930b5ed · outbound

This paper cites M., & Daw, N.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models M., & Daw, N

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:48:19.127987Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:48:18.694315Z digest=sha256:079ac1c9ef385bacc6112190f03683437e2cc4ec636b0bfae5c450b5549783bf

Observation 9ddfbf91-19f2-4714-bbdc-235b33366262 · outbound

This paper cites (2025, April 30).

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models (2025, April 30)

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:48:19.119230Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:48:18.697755Z digest=sha256:59fc560af4832cccd99f200375dc1e7d85b8362ac502d08e524dc6d42f34c948

Observation b39862d8-ce43-47f7-844f-957846d06e8f · outbound

This paper cites an unresolved cited work.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Unresolved cited work

Reference 8

Resolution
unresolved
raw_fallback, observed 2026-08-07T05:48:19.110513Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:48:18.700779Z digest=sha256:cb309a1b87f977017e478b5f74d455036b0809d802103c8b8c54b0093f2d8037

Observation e730bfc6-e3a6-4a94-ab32-a95e4216e086 · outbound

This paper cites Risks from Learned Optimization in Advanced Machine Learning Systems.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Risks from Learned Optimization in Advanced Machine Learning Systems

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.703719Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.703719Z digest=sha256:11e37c74b476990a28dd9f96a404774660caf7e008dc1ce6d580a9fdf724ffad

Observation 4a69ce99-64f9-4aea-8806-6bc031bb9582 · outbound

This paper cites J., Madotto, A., & Fung, P.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models J., Madotto, A., & Fung, P

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.707257Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.707257Z digest=sha256:f3d1b15475001ef3491143e8d1bf767db01851b9672ffeafb7c1a2a9784f5b56

Observation 8f402b56-e2e0-4ef0-bfd4-d525c25fa11a · outbound

This paper cites Language Models (Mostly) Know What They Know.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Language Models (Mostly) Know What They Know

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.710373Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.710373Z digest=sha256:87d41c3eabded23ab2aa013b249972d702b4ab4601fe3a521d8e103e4d998aed

Observation b81764dd-ef14-4a02-be18-39d51fb5d48b · outbound

This paper cites an unresolved cited work.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Unresolved cited work

Reference 12

Resolution
unresolved
raw_fallback, observed 2026-08-07T05:48:19.100206Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:48:18.713713Z digest=sha256:165594ea8cb5b322f67c67937490f42bc04ac8d64a04804519f677b8828d2ecb

Observation 2e5dd03d-1075-4823-9f36-5942d21527f2 · outbound

This paper cites An Extensive Evaluation of Factual Consistency in Large Language Models for Data-to-Text Generation.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models An Extensive Evaluation of Factual Consistency in Large Language Models for Data-to-Text Generation

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-08-07T05:48:18.954423Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:48:18.717088Z digest=sha256:183154fe6874a6fbe248ed19e866f3607916e448076625af52cb940f3f913321

Observation 3c3a3762-9a4b-42d2-b847-2a4f0e3c7fa0 · outbound

This paper cites Self-Refine: Iterative Refinement with Self-Feedback.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Self-Refine: Iterative Refinement with Self-Feedback

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.720267Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.720267Z digest=sha256:8004bd9ce63a24af55dfc1916450e1b062cc9fcef1ef9bb34e77dd628462be82

Observation 3f14e3bd-1841-425e-87f1-78a2aecff5c8 · outbound

This paper cites (2025, January 28).

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models (2025, January 28)

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:48:19.091152Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:48:18.723677Z digest=sha256:231789d364b9f2f4dc76a78fbc1befd8a88e4ddfa78010f29905b63b85141ac0

Observation 0f12f923-b83b-4644-85fa-769ee9358583 · outbound

This paper cites an unresolved cited work.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Unresolved cited work

Reference 16

Resolution
unresolved
raw_fallback, observed 2026-08-07T05:48:19.082051Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:48:18.726713Z digest=sha256:6bce59598b10ebf6e54ea70438e9df4cfd11b8ef9e01d49cf5172d60b3ffc5c8

Observation 909b254f-98bd-4f5a-aee7-6d0d9ecd945d · outbound

This paper cites GPT-4 Technical Report.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models GPT-4 Technical Report

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.729834Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.729834Z digest=sha256:5f748475dbf2c9d6551ee89cf5530a61e679a124eb1d70b4e9b785c74a0cada1

Observation 993b0081-e2ce-4874-8b9c-27e3287e84e8 · outbound

This paper cites & Lowe, R.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models & Lowe, R

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:48:19.072558Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:48:18.733751Z digest=sha256:202f077c058fcdbc66016b218a315607bf1abbacfe8c6fb0117b83bfd464c642

Observation 319f121d-f7be-4b3d-bb7c-32c8f7e5aaca · outbound

This paper cites Measuring and Benchmarking Large Language Models' Capabilities to Generate Persuasive Language.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Measuring and Benchmarking Large Language Models' Capabilities to Generate Persuasive Language

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.736717Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.736717Z digest=sha256:1a286e97a656ac1fe7e72c098e2bfaedff769e7bb57a45a6a35cc29c7c9b01f2

Observation 2cdaf0f9-fac2-48fa-a533-58f61e1a17aa · outbound

This paper cites Discovering Language Model Behaviors with Model-Written Evaluations.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Discovering Language Model Behaviors with Model-Written Evaluations

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.740179Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.740179Z digest=sha256:2017b04ea4e92ab063d7dab569c03cb7a8aedfa6c5dabac3b027607a95dffc18

Observation f80abd4b-c4ec-4e6a-a5db-cc57c0a0b564 · outbound

This paper cites Towards Understanding Sycophancy in Language Models.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Towards Understanding Sycophancy in Language Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.743441Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.743441Z digest=sha256:53cd52d12e2f128b13433ff2296eecc4475cdbc11cf6f58865469b04c4c4142a

Observation f65fc0bd-1523-4229-a7ee-f6471302f18a · outbound

This paper cites Factuality of Large Language Models: A Survey.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Factuality of Large Language Models: A Survey

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.746771Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.746771Z digest=sha256:4d5203d7d5e07c213bcfd9d0d09ad7a2f2f10b67b21caf45313181c8374e98e7

Observation 2d5ce6e7-4f3b-4b59-be71-657dc31564ee · outbound

This paper cites an unresolved cited work.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Unresolved cited work

Reference 23

Resolution
unresolved
raw_fallback, observed 2026-08-07T05:48:19.063567Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:48:18.749955Z digest=sha256:3e7e4cc56b9ebe84ebd821a927aa18a6ee975abe44d5bd18cae1424a146c0fa1

Observation b0ec885d-1048-4ee7-9218-0abf556dda90 · outbound

This paper cites (2024).OpenFactCheck: A Unified Framework for Factuality Evaluation of LLMs.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models (2024).OpenFactCheck: A Unified Framework for Factuality Evaluation of LLMs

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.752928Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.752928Z digest=sha256:1578b5d472dc7fe1c2dde7bdbc182c0861959167997a65860b6c598b8196407d

Observation a67319c4-9aba-48ee-a765-8ba08e47cab0 · outbound

This paper cites Measuring short-form factuality in large language models.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Measuring short-form factuality in large language models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.755967Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.755967Z digest=sha256:3814b0c84bac74e9d7078cafde7d136004eb107e47e8f3db0cf8c80fd623dcbd

Observation db70f714-40be-4af9-9c46-4c8fdccd6114 · outbound

This paper cites Belief Revision: The Adaptability of Large Language Models Reasoning.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Belief Revision: The Adaptability of Large Language Models Reasoning

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.759340Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.759340Z digest=sha256:b1e7cfc0fb62883940495425c1fb662e3529bb12f663138189d1aae0fc1339c3

Observation a177b9fb-1376-40c8-be69-b7d7ad8c4bb9 · outbound

This paper cites A Survey of Large Language Models.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models A Survey of Large Language Models

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.762671Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.762671Z digest=sha256:d53804cde3d7b257b77f84d03f58a3e4aef5e7a932f931a92f0927179c7767f2

Pith citing papers

Observation c96603d8-3ba7-4d44-86c3-920d4ea43f0a · inbound

Is Agentic AI Ready for Real-World Hardware Engineering? A Deep Dive with Phoenix-bench cites this paper.

Is Agentic AI Ready for Real-World Hardware Engineering? A Deep Dive with Phoenix-bench AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-05-19T17:52:43.083675Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-05-19T17:49:01.198956Z digest=sha256:e183958d95855561c839e4c171777e97d1dd707f7e584d42101dd79d15077a1f