Pith. sign in

Paper Citation Record · LEDGER

NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 32 inbound Pith citation observations for arXiv:2406.04520.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2406.04520 v1

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 32 of 32 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00

measured 32 of 32 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T13:32:35.222863Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T13:59:51.822438Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 37e5cd86-be56-4489-9a55-34baba46d34a · inbound

Training Language Models to Self-Correct via Reinforcement Learning cites this paper.

Training Language Models to Self-Correct via Reinforcement Learning NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 59

Resolution
metadata mismatch
arxiv_id, observed 2026-05-17T12:04:10.504299Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-05-17T12:04:10.210508Z digest=sha256:22df0e3a50a8017487fa1dee1a7ab6771b26b8f14a2b84a47ee3cea33eade9ba

Observation 1300e581-84e5-4e4f-8f68-02e4d4f2a5c8 · inbound

ChinaTravel: An Open-Ended Travel Planning Benchmark with Compositional Constraint Validation for Language Agents cites this paper.

ChinaTravel: An Open-Ended Travel Planning Benchmark with Compositional Constraint Validation for Language Agents NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 33

Resolution
verified exact
arxiv_id, observed 2026-05-23T07:12:41.542281Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-23T07:09:43.442736Z digest=sha256:f792b396c36b3f73754e6b10bfec5d987714348a090c3e26664c1a5c04c72407

Observation 8b60198b-8768-4086-bab5-005f4f0a4d71 · inbound

Make Planning Research Rigorous Again! cites this paper.

Make Planning Research Rigorous Again! NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 118

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:35.222863Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:32:35.222863Z digest=sha256:a225ae6a5a0a9f77adcdc1806a9985ec7a90eafe47c366c14fb4455dd7d464d2

Observation 2fc36915-60ff-431f-b62d-6c4b967cd63f · inbound

Flex-TravelPlanner: A Benchmark for Flexible Planning with Language Agents cites this paper.

Flex-TravelPlanner: A Benchmark for Flexible Planning with Language Agents NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T10:42:05.447049Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:42:05.447049Z digest=sha256:3b1512c56b2a0e9e9bf1aa509791ff3e8d6a03ebee3633dbdfa51ecf04c3e2e6

Observation 3f1b9139-7109-4809-907e-8bb7be6e5fb6 · inbound

LogiPlan: A Structured Benchmark for Logical Planning and Relational Reasoning in LLMs cites this paper.

LogiPlan: A Structured Benchmark for Logical Planning and Relational Reasoning in LLMs NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T04:28:47.872578Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T04:28:47.872578Z digest=sha256:7ddce6faa5499faf3741418603bf997a716e810c240291b8b1d77d85ab8fa009

Observation 067558ea-3b41-4cb4-9ea6-df9f104b1b8e · inbound

Evolutionary Perspectives on the Evaluation of LLM-Based AI Agents: A Comprehensive Survey cites this paper.

Evolutionary Perspectives on the Evaluation of LLM-Based AI Agents: A Comprehensive Survey NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 196

Resolution
unresolved
no resolver link, observed 2026-08-07T06:00:19.892698Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T06:00:19.892698Z digest=sha256:9cc54a855debe62ea6b1e0278ad86a05e2f66ae9f9bf0e76d058d2902374e9b7

Observation 4e126a35-b617-4082-925f-449620976d1b · inbound

A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence cites this paper.

A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 86

Resolution
metadata mismatch
arxiv_id, observed 2026-05-14T22:23:15.711668Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-05-14T22:23:14.621091Z digest=sha256:c58288888df901825e1f2d15a8457b02ca5ac14afd07a067bd946131ac52c4cd

Observation ca1758e0-256a-4b6e-bdb3-7c4418888108 · inbound

ISO-Bench: Benchmarking Multimodal Causal Reasoning in Visual-Language Models through Procedural Plans cites this paper.

ISO-Bench: Benchmarking Multimodal Causal Reasoning in Visual-Language Models through Procedural Plans NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T11:08:11.607173Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T11:08:11.607173Z digest=sha256:8b5aac136f72a61616b0f2046c4e89d0aa346eaabe8415a1e4c7923a0e55a267

Observation c995e071-1e8c-4969-9b34-55c5c68ada16 · inbound

Can LLM-Reasoning Models Replace Classical Planning? A Benchmark Study cites this paper.

Can LLM-Reasoning Models Replace Classical Planning? A Benchmark Study NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T10:45:59.570552Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T10:45:59.570552Z digest=sha256:fb0a2f719ec5e752793b97b1e2e1f61a143b54edd6313492b4aaf24500372b45

Observation df672c84-54ba-4139-a9b0-f012eb1b6315 · inbound

Dream 7B: Diffusion Large Language Models cites this paper.

Dream 7B: Diffusion Large Language Models NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-05-11T16:25:53.408460Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-11T16:25:53.143469Z digest=sha256:294486d8d95b862b7c392f345f7acb3c63545497fd160ab73438c1ff27cfc30b

Observation 92ce1154-07ce-4cac-9126-4598e85f7a46 · inbound

DoubleAgents: Human-Agent Alignment in a Socially Embedded Workflow cites this paper.

DoubleAgents: Human-Agent Alignment in a Socially Embedded Workflow NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 55

Resolution
verified exact
arxiv_id, observed 2026-05-18T17:11:40.356821Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-18T17:09:02.466082Z digest=sha256:d930a79bbf5390f410262d5452971e24cc28088dd5c98ca3dee102e88cf98fb9

Observation 3488c4b6-ea63-4525-8e13-8e014c2e2a4e · inbound

End-to-end PDDL Planning with Hardcoded and Dynamic Agents cites this paper.

End-to-end PDDL Planning with Hardcoded and Dynamic Agents NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 41

Resolution
metadata mismatch
arxiv_id, observed 2026-05-16T23:38:41.708009Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-05-16T23:34:20.411940Z digest=sha256:e64c41692dbe716501629a023352416b55b7925a00df8e9716554efd518eaafe

Observation 9ca36b71-9b13-4e92-b597-9cac6c589198 · inbound

Programming over Thinking: Efficient and Robust Multi-Constraint Planning cites this paper.

Programming over Thinking: Efficient and Robust Multi-Constraint Planning NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-03T10:46:57.500704Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T10:46:57.500704Z digest=sha256:af43a0e30777693dc75f029e673e2573fd93c6496b925975dd6032545f4c38e7

Observation e3cabc62-623d-4118-8735-d697558512b0 · inbound

LLM-WikiRace Benchmark: How Far Can LLMs Plan over Real-World Knowledge Graphs? cites this paper.

LLM-WikiRace Benchmark: How Far Can LLMs Plan over Real-World Knowledge Graphs? NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-02T22:26:39.609708Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T22:26:39.609708Z digest=sha256:5985ebcdac2b593df6ee1616c712eadc79214f3e1ed60fb589eef870462b373d

Observation e3f84698-33d2-44e5-9f24-aed5a9073c27 · inbound

Learning to Interrupt in Language-based Multi-agent Communication cites this paper.

Learning to Interrupt in Language-based Multi-agent Communication NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 46

Resolution
metadata mismatch
arxiv_id, observed 2026-05-10T23:25:53.687359Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-05-10T19:08:45.818851Z digest=sha256:5ac876dc4cf5feb5f6e26737c8569742eb122ba64375869e99ad2a5747ffcce2

Observation 99c42156-37cc-4220-8939-c6493d97c0de · inbound

IE as Cache: Information Extraction Enhanced Agentic Reasoning cites this paper.

IE as Cache: Information Extraction Enhanced Agentic Reasoning NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 33

Resolution
metadata mismatch
arxiv_id, observed 2026-05-10T10:49:55.864171Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-10T10:49:50.177400Z digest=sha256:201fad7e2ec1acd445948ac1bf4cb97efad7601425b3019dec7720c47ebc2bc3

Observation 90f03aa4-7e52-4f7e-903f-a74e65fb4be2 · inbound

Extracting Search Trees from LLM Reasoning Traces Reveals Myopic Planning cites this paper.

Extracting Search Trees from LLM Reasoning Traces Reveals Myopic Planning NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 36

Resolution
verified exact
arxiv_id, observed 2026-05-11T05:05:56.713740Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-11T00:52:59.406190Z digest=sha256:7015d26ad2171d53ee70a22d62a59794775e2a44d3f08bf44cf523f6522f16e5

Observation 5e734042-f403-45a6-a7b3-582e60dd121e · inbound

Extracting Search Trees from LLM Reasoning Traces Reveals Myopic Planning cites this paper.

Extracting Search Trees from LLM Reasoning Traces Reveals Myopic Planning NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 36

Resolution
verified exact
arxiv_id, observed 2026-05-12T07:41:28.603949Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-12T02:23:55.323250Z digest=sha256:3535ecf5cfe67f792c9c734f30888e660cc49bc9651000d23ed9f30540b9de3f

Observation bcb47b33-1232-4619-a08e-536ed6a74004 · inbound

Extracting Search Trees from LLM Reasoning Traces Reveals Myopic Planning cites this paper.

Extracting Search Trees from LLM Reasoning Traces Reveals Myopic Planning NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 36

Resolution
verified exact
arxiv_id, observed 2026-05-13T06:22:23.231324Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-13T06:21:00.353334Z digest=sha256:bff10f4ace406c6202cb36bec6f1b5e0fbd4102cfc5fbe65bbce4e6242a21065

Observation 7f26c506-eba0-44fa-b45b-b14a35215cc7 · inbound

Extracting Search Trees from LLM Reasoning Traces Reveals Myopic Planning cites this paper.

Extracting Search Trees from LLM Reasoning Traces Reveals Myopic Planning NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 36

Resolution
verified exact
arxiv_id, observed 2026-05-14T20:59:27.824924Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-14T20:55:31.770238Z digest=sha256:7aaa0fac9217bcfd07ec262a73b6e91f07bcf2937d6e938e99341fc9554bfa8c

Observation 513b9174-d572-4252-8212-949f5fdd5def · inbound

Extracting Search Trees from LLM Reasoning Traces Reveals Myopic Planning cites this paper.

Extracting Search Trees from LLM Reasoning Traces Reveals Myopic Planning NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 36

Resolution
verified exact
arxiv_id, observed 2026-05-25T06:00:23.404420Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-25T05:57:58.487109Z digest=sha256:9ef766a85c0c4b188b38a62f52352f65d886b9203b1c2e9d1793ff36fef6cbee

Observation d0534a05-5d73-4e61-b020-5abf2eef5e68 · inbound

TransitLM: A Large-Scale Dataset and Benchmark for Map-Free Transit Route Generation cites this paper.

TransitLM: A Large-Scale Dataset and Benchmark for Map-Free Transit Route Generation NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 43

Resolution
metadata mismatch
arxiv_id, observed 2026-05-22T05:51:08.865641Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T05:47:29.031123Z digest=sha256:c700deddb39916b9fb20efae2fe02ad70ca3ac65107ec59fa06eb54fb4e72f87

Observation 1e026219-115f-4132-878c-cba6445443e1 · inbound

Inducing Reasoning Primitives from Agent Traces cites this paper.

Inducing Reasoning Primitives from Agent Traces NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-07-02T02:26:26.916687Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-06-28T10:54:57.324498Z digest=sha256:52f1943f72e82c1aa316980eed57678e701fa45b97f975b65a4dee7279aeb253

Observation b5c3602b-a9b1-419a-9dd4-8b28afb9ed55 · inbound

A Close Look At World Model Recovery In Supervised Fine-Tuned LLM Planners cites this paper.

A Close Look At World Model Recovery In Supervised Fine-Tuned LLM Planners NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 30

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T01:46:26.398207Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-06-28T11:36:14.896698Z digest=sha256:9ed362814325fe031f9fb61504ba225b69911b87b4036719735979f64a6d3d84

Observation 5b780118-1d35-427a-b4ab-d27d3152a32e · inbound

Training the Orchestrator: A Supervised Approach to End-to-End PDDL Planning with LLM Agents cites this paper.

Training the Orchestrator: A Supervised Approach to End-to-End PDDL Planning with LLM Agents NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 64

Resolution
verified exact
arxiv_id, observed 2026-07-04T06:59:38.192958Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-06-26T13:56:51.914966Z digest=sha256:fc5c50926a2862a6ccad4b753f95de69ac1eb2126b12db3c4e4e1cc3527df067

Observation 1a0fa1fb-b79e-40a5-ab0d-23079d64995f · inbound

Einstein World Models cites this paper.

Einstein World Models NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-07-04T13:59:51.823996Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-06-26T04:47:59.575489Z digest=sha256:3903e0cc6a7bc059458cec01a694b0838faedf954841530512de54f2e32f11ef

Observation 993dfd27-3347-47c6-b307-329c7274927f · inbound

Object Aligner: A Configurable JSON Schema Similarity Score for Graphs, Applied to LLM Prompt Optimization cites this paper.

Object Aligner: A Configurable JSON Schema Similarity Score for Graphs, Applied to LLM Prompt Optimization NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 58

Resolution
metadata mismatch
arxiv_id, observed 2026-07-03T14:58:32.444975Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-07-03T14:54:36.915852Z digest=sha256:360ce191103e84d75ca23a76fa01a6e0d9f77b21db2d0efce8c8f737d32d1024

Observation bbbd66e0-afc1-4b4b-a0e8-3ac65aea0700 · inbound

Multi-Turn On-Policy Distillation with Prefix Replay cites this paper.

Multi-Turn On-Policy Distillation with Prefix Replay NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 153

Resolution
unresolved
no resolver link, observed 2026-07-11T13:53:36.775836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-07-11T13:53:36.775836Z digest=sha256:846bdd0dcea47cbd60d2e713f8e4452ae994018200c76db0ff721c8ca5bf4a88

Observation 435dcd78-ace1-47c7-aff7-5326416933c5 · inbound

Multi-Turn On-Policy Distillation with Prefix Replay cites this paper.

Multi-Turn On-Policy Distillation with Prefix Replay NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 154

Resolution
unresolved
no resolver link, observed 2026-08-02T08:40:49.410640Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T08:40:49.410640Z digest=sha256:5437281ce946375428c137b8b78091492d69b126cdfabe166e3ae6d91ca0e21d

Observation 1c1678b8-4fbd-4301-9942-84b96c067510 · inbound

TREK: A Travel Reasoning and Evaluation Kit for LLM Agents in Complex Trip Planning cites this paper.

TREK: A Travel Reasoning and Evaluation Kit for LLM Agents in Complex Trip Planning NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 112

Resolution
unresolved
no resolver link, observed 2026-07-30T15:14:06.324551Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T15:14:06.324551Z digest=sha256:295a2c78b1ea31a25790d7e6fb0539d5e9709009b384cc8dc8a6354bd95960dd

Observation eb204b0b-ca29-4062-938a-b8a90a35ada4 · inbound

SCHEDBench: A Benchmark for Evaluating LLM Constraint Faithfulness in Natural-Language Combinatorial Scheduling cites this paper.

SCHEDBench: A Benchmark for Evaluating LLM Constraint Faithfulness in Natural-Language Combinatorial Scheduling NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T00:40:34.550973Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T00:40:34.550973Z digest=sha256:f3580c94f7e88f72ca063ea3d4b5597c32c696b816174085e6c4e6101d34ce9c

Observation c0bce8bd-4215-492e-b0f8-185d3f0d0725 · inbound

Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning cites this paper.

Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning NATURAL PLAN: Benchmarking LLMs on Natural Language Planning

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-06T04:30:45.725769Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:30:45.725769Z digest=sha256:3d9ea701681b9eb8c4bc5ece205a7d7857ade48bdf03d24ecc52d3adb52a3338