{"as_of":"2026-08-22T11:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c723c592862f0e1cd6ff759fcde6b752cf61a5d1c7d6769bad2e2ae2ee15f4f1","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:12:48.107868Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T16:53:40.615942Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.20015","last_updated":"2024-10-04T07:51:29Z","snapshot_observed_at":"2026-08-18T13:56:56.933519Z","submitted_at":"2024-06-28T16:03:30Z","title":"ToolBeHonest: A Multi-level Hallucination Diagnostic Benchmark for Tool-Augmented Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20015","snapshot_observed_at":"2026-08-11T21:47:17.066252Z","title":"Toolbehonest: A multi-level hallucination diagnostic benchmark for tool-augmented large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04141","last_updated":"2025-05-29T08:04:32Z","snapshot_observed_at":"2026-08-15T00:09:02.045110Z","submitted_at":"2024-12-05T13:10:54Z","title":"Reducing Tool Hallucination via Reliability Alignment","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T21:47:17.066252Z"},"links":{"cited_paper":"/paper/2406.20015","citing_paper":"/paper/2412.04141"},"observation_digest":"sha256:f36f12c8bca486e652336f3a86748036aff8e7fce78d202625a06c8eacb1d723","observation_id":"a162cb5d-ab0e-473a-9ff9-4827dec9ee5e","resolution":{"observed_at":"2026-08-11T21:47:17.066252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20015","last_updated":"2024-10-04T07:51:29Z","snapshot_observed_at":"2026-08-18T13:56:56.933519Z","submitted_at":"2024-06-28T16:03:30Z","title":"ToolBeHonest: A Multi-level Hallucination Diagnostic Benchmark for Tool-Augmented Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20015","snapshot_observed_at":"2026-08-16T10:12:48.107868Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18851","last_updated":"2025-04-26T08:30:02Z","snapshot_observed_at":"2026-08-18T11:07:37.063310Z","submitted_at":"2025-04-26T08:30:02Z","title":"When2Call: When (not) to Call Tools","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T10:12:48.107868Z"},"links":{"cited_paper":"/paper/2406.20015","citing_paper":"/paper/2504.18851"},"observation_digest":"sha256:306ff766e3ee810de666c2af67bf48ba7429613a7e836e02a9d315fb47a33749","observation_id":"79e100d3-f173-4ecf-8cad-bceb313c8fa4","resolution":{"observed_at":"2026-08-16T10:12:48.107868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20015","last_updated":"2024-10-04T07:51:29Z","snapshot_observed_at":"2026-08-18T13:56:56.933519Z","submitted_at":"2024-06-28T16:03:30Z","title":"ToolBeHonest: A Multi-level Hallucination Diagnostic Benchmark for Tool-Augmented Large Language Models","version":2},"cited_work":{"arxiv_id":"2406.20015","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.20015","snapshot_observed_at":"2026-06-29T16:53:40.615942Z","title":"Toolbehonest: A multi-level hallucination diagnostic benchmark for tool-augmented large language models","venue":null,"work_id":"36ea12fe-9d01-4388-8fd2-170e860ca452","year":2024},"citing_paper":{"arxiv_id":"2510.02837","last_updated":"2026-05-25T02:56:44Z","snapshot_observed_at":"2026-08-12T10:11:19.597552Z","submitted_at":"2025-10-03T09:19:15Z","title":"Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T11:02:55.529271Z"},"links":{"cited_paper":"/paper/2406.20015","citing_paper":"/paper/2510.02837"},"observation_digest":"sha256:70673c05e6edf9556f35d48ad0b1d20727b73fb842629971d2d5031950517ce9","observation_id":"7a802829-5b63-4fef-9498-339fe3536c9e","resolution":{"observed_at":"2026-05-18T11:06:17.768323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20015","last_updated":"2024-10-04T07:51:29Z","snapshot_observed_at":"2026-08-18T13:56:56.933519Z","submitted_at":"2024-06-28T16:03:30Z","title":"ToolBeHonest: A Multi-level Hallucination Diagnostic Benchmark for Tool-Augmented Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20015","snapshot_observed_at":"2026-08-04T12:44:13.276790Z","title":"A multimodal foundation agent for financial trading: Tool- augmented, diversified, and generalist","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02837","last_updated":"2026-05-25T02:56:44Z","snapshot_observed_at":"2026-08-12T10:11:19.597552Z","submitted_at":"2025-10-03T09:19:15Z","title":"Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T12:44:13.276790Z"},"links":{"cited_paper":"/paper/2406.20015","citing_paper":"/paper/2510.02837"},"observation_digest":"sha256:3e4f889255abfb474ea5efafc6b3d5b1f5b6fcccd6c7f59f49a3d4db8105f8a8","observation_id":"29b5b9a9-4885-482b-a389-0d078725eb55","resolution":{"observed_at":"2026-08-04T12:44:13.276790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20015","last_updated":"2024-10-04T07:51:29Z","snapshot_observed_at":"2026-08-18T13:56:56.933519Z","submitted_at":"2024-06-28T16:03:30Z","title":"ToolBeHonest: A Multi-level Hallucination Diagnostic Benchmark for Tool-Augmented Large Language Models","version":2},"cited_work":{"arxiv_id":"2406.20015","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.20015","snapshot_observed_at":"2026-06-29T16:53:40.615942Z","title":"Toolbehonest: A multi-level hallucination diagnostic benchmark for tool-augmented large language models","venue":null,"work_id":"36ea12fe-9d01-4388-8fd2-170e860ca452","year":2024},"citing_paper":{"arxiv_id":"2510.23853","last_updated":"2026-04-15T18:39:35Z","snapshot_observed_at":"2026-08-15T02:20:35.788665Z","submitted_at":"2025-10-27T20:51:58Z","title":"Your LLM Agents are Temporally Blind: The Misalignment Between Tool Use Decisions and Human Time Perception","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-18T03:46:03.228969Z"},"links":{"cited_paper":"/paper/2406.20015","citing_paper":"/paper/2510.23853"},"observation_digest":"sha256:f20b552f21f1668d259c84ba69f74c3ecbe918e3cbc04ffb9be3553435a9fa6d","observation_id":"6c08a245-735d-493f-8bf9-cc39efbb1b4c","resolution":{"observed_at":"2026-05-18T03:50:52.552687Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20015","last_updated":"2024-10-04T07:51:29Z","snapshot_observed_at":"2026-08-18T13:56:56.933519Z","submitted_at":"2024-06-28T16:03:30Z","title":"ToolBeHonest: A Multi-level Hallucination Diagnostic Benchmark for Tool-Augmented Large Language Models","version":2},"cited_work":{"arxiv_id":"2406.20015","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.20015","snapshot_observed_at":"2026-06-29T16:53:40.615942Z","title":"Toolbehonest: A multi-level hallucination diagnostic benchmark for tool-augmented large language models","venue":null,"work_id":"36ea12fe-9d01-4388-8fd2-170e860ca452","year":2024},"citing_paper":{"arxiv_id":"2605.14038","last_updated":"2026-05-17T15:23:37Z","snapshot_observed_at":"2026-08-12T12:49:20.570541Z","submitted_at":"2026-05-13T18:59:28Z","title":"Model-Adaptive Tool Necessity Reveals the Knowing-Doing Gap in LLM Tool Use","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:54.252816Z"},"links":{"cited_paper":"/paper/2406.20015","citing_paper":"/paper/2605.14038"},"observation_digest":"sha256:7a01ffa67dfdb500cef8e856f02ff025868fa6a78cb8885100bd126d494626df","observation_id":"3baf782e-911a-4674-a71f-5abbd8aec7c6","resolution":{"observed_at":"2026-05-15T05:35:04.458129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20015","last_updated":"2024-10-04T07:51:29Z","snapshot_observed_at":"2026-08-18T13:56:56.933519Z","submitted_at":"2024-06-28T16:03:30Z","title":"ToolBeHonest: A Multi-level Hallucination Diagnostic Benchmark for Tool-Augmented Large Language Models","version":2},"cited_work":{"arxiv_id":"2406.20015","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.20015","snapshot_observed_at":"2026-06-29T16:53:40.615942Z","title":"Toolbehonest: A multi-level hallucination diagnostic benchmark for tool-augmented large language models","venue":null,"work_id":"36ea12fe-9d01-4388-8fd2-170e860ca452","year":2024},"citing_paper":{"arxiv_id":"2605.14038","last_updated":"2026-05-17T15:23:37Z","snapshot_observed_at":"2026-08-12T12:49:20.570541Z","submitted_at":"2026-05-13T18:59:28Z","title":"Model-Adaptive Tool Necessity Reveals the Knowing-Doing Gap in LLM Tool Use","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T20:52:20.975459Z"},"links":{"cited_paper":"/paper/2406.20015","citing_paper":"/paper/2605.14038"},"observation_digest":"sha256:55bb56da487319360d7ad12b60db455d4dd6e73b5dabc2b6a13843719d910db4","observation_id":"a24ddf88-4a77-4ff5-babe-b378d297ab64","resolution":{"observed_at":"2026-05-20T20:53:43.543715Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20015","last_updated":"2024-10-04T07:51:29Z","snapshot_observed_at":"2026-08-18T13:56:56.933519Z","submitted_at":"2024-06-28T16:03:30Z","title":"ToolBeHonest: A Multi-level Hallucination Diagnostic Benchmark for Tool-Augmented Large Language Models","version":2},"cited_work":{"arxiv_id":"2406.20015","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.20015","snapshot_observed_at":"2026-06-29T16:53:40.615942Z","title":"Toolbehonest: A multi-level hallucination diagnostic benchmark for tool-augmented large language models","venue":null,"work_id":"36ea12fe-9d01-4388-8fd2-170e860ca452","year":2024},"citing_paper":{"arxiv_id":"2605.27209","last_updated":"2026-05-26T16:02:00Z","snapshot_observed_at":"2026-08-13T12:46:09.126090Z","submitted_at":"2026-05-26T16:02:00Z","title":"Learning to Act under Noise: Enhancing Agent Robustness via Noisy Environments","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-29T16:51:36.524194Z"},"links":{"cited_paper":"/paper/2406.20015","citing_paper":"/paper/2605.27209"},"observation_digest":"sha256:e2656131583043bad3a91be4c2db9ca613e472d349f0995b507541289b24cd3b","observation_id":"27a4c51f-cec4-441a-9980-a3141ab48d2a","resolution":{"observed_at":"2026-06-29T16:53:40.617632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20015","last_updated":"2024-10-04T07:51:29Z","snapshot_observed_at":"2026-08-18T13:56:56.933519Z","submitted_at":"2024-06-28T16:03:30Z","title":"ToolBeHonest: A Multi-level Hallucination Diagnostic Benchmark for Tool-Augmented Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20015","snapshot_observed_at":"2026-08-02T15:11:09.603684Z","title":"name\": \"get_definition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18245","last_updated":"2026-04-30T19:33:58Z","snapshot_observed_at":"2026-08-14T11:44:04.299287Z","submitted_at":"2026-04-30T19:33:58Z","title":"SAAG: Structured Agent Assessment and Grounding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T15:11:09.603684Z"},"links":{"cited_paper":"/paper/2406.20015","citing_paper":"/paper/2607.18245"},"observation_digest":"sha256:6b5deb7c16fb6fb1713a9df8ea6eb87784172f58c6e9695f6da5ad276c1180f5","observation_id":"39fad04c-9c0d-4f00-8d94-09b7a528e154","resolution":{"observed_at":"2026-08-02T15:11:09.603684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.20015/citation-record","integrity":"/paper/2406.20015/integrity","json":"/paper/2406.20015/citation-record.json","paper":"/paper/2406.20015"},"outbound":[],"paper":{"arxiv_id":"2406.20015","last_updated":"2024-10-04T07:51:29Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T13:56:56.933519Z","submitted_at":"2024-06-28T16:03:30Z","title":"ToolBeHonest: A Multi-level Hallucination Diagnostic Benchmark for Tool-Augmented Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2406.20015."}