Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-07T05:48:18.762671Z
Paper Citation Record · LEDGER
As of 8 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 1 inbound Pith citation observation for arXiv:2506.11110.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-07T05:48:18.762671Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-05-19T17:49:01.198956Z
A source-named dated measurement, never combined with another source.
Source: arxiv_reference, observed 2026-05-19T17:52:43.078608Z
27 of 27 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation ca8b12ba-acf4-4680-97e9-4b44f66a4dde · outbound
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Unresolved cited work
Reference 1
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation a8801b79-71de-4efb-8102-d2978f32e8e6 · outbound
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models On the Opportunities and Risks of Foundation Models
Reference 2
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ecb9b38d-20a2-44e3-bcb3-9c35e283c271 · outbound
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Unresolved cited work
Reference 3
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 22e083f8-5051-4f3b-aa9e-db05d3809bee · outbound
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6b2f8c53-b099-458e-a10e-bf6182cea7cb · outbound
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models N., Agarwal, A
Reference 5
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation db6f8624-e4bd-4c88-9df9-582ee930b5ed · outbound
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models M., & Daw, N
Reference 6
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 9ddfbf91-19f2-4714-bbdc-235b33366262 · outbound
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models (2025, April 30)
Reference 7
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation b39862d8-ce43-47f7-844f-957846d06e8f · outbound
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Unresolved cited work
Reference 8
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation e730bfc6-e3a6-4a94-ab32-a95e4216e086 · outbound
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Risks from Learned Optimization in Advanced Machine Learning Systems
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4a69ce99-64f9-4aea-8806-6bc031bb9582 · outbound
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models J., Madotto, A., & Fung, P
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8f402b56-e2e0-4ef0-bfd4-d525c25fa11a · outbound
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Language Models (Mostly) Know What They Know
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b81764dd-ef14-4a02-be18-39d51fb5d48b · outbound
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Unresolved cited work
Reference 12
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 2e5dd03d-1075-4823-9f36-5942d21527f2 · outbound
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models An Extensive Evaluation of Factual Consistency in Large Language Models for Data-to-Text Generation
Reference 13
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 3c3a3762-9a4b-42d2-b847-2a4f0e3c7fa0 · outbound
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Self-Refine: Iterative Refinement with Self-Feedback
Reference 14
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3f14e3bd-1841-425e-87f1-78a2aecff5c8 · outbound
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models (2025, January 28)
Reference 15
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 0f12f923-b83b-4644-85fa-769ee9358583 · outbound
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Unresolved cited work
Reference 16
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 909b254f-98bd-4f5a-aee7-6d0d9ecd945d · outbound
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models GPT-4 Technical Report
Reference 17
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 993b0081-e2ce-4874-8b9c-27e3287e84e8 · outbound
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models & Lowe, R
Reference 18
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 319f121d-f7be-4b3d-bb7c-32c8f7e5aaca · outbound
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Measuring and Benchmarking Large Language Models' Capabilities to Generate Persuasive Language
Reference 19
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2cdaf0f9-fac2-48fa-a533-58f61e1a17aa · outbound
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Discovering Language Model Behaviors with Model-Written Evaluations
Reference 20
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f80abd4b-c4ec-4e6a-a5db-cc57c0a0b564 · outbound
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Towards Understanding Sycophancy in Language Models
Reference 21
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f65fc0bd-1523-4229-a7ee-f6471302f18a · outbound
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Factuality of Large Language Models: A Survey
Reference 22
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2d5ce6e7-4f3b-4b59-be71-657dc31564ee · outbound
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Unresolved cited work
Reference 23
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation b0ec885d-1048-4ee7-9218-0abf556dda90 · outbound
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models (2024).OpenFactCheck: A Unified Framework for Factuality Evaluation of LLMs
Reference 24
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a67319c4-9aba-48ee-a765-8ba08e47cab0 · outbound
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Measuring short-form factuality in large language models
Reference 25
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation db70f714-40be-4af9-9c46-4c8fdccd6114 · outbound
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Belief Revision: The Adaptability of Large Language Models Reasoning
Reference 26
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a177b9fb-1376-40c8-be69-b7d7ad8c4bb9 · outbound
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models A Survey of Large Language Models
Reference 27
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c96603d8-3ba7-4d44-86c3-920d4ea43f0a · inbound
Is Agentic AI Ready for Real-World Hardware Engineering? A Deep Dive with Phoenix-bench AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models
Reference 15
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.