{"as_of":"2026-08-07T05:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:71ea7bf1ddb1ea8f29c78ff380c7b254a1fbf81dbdf44c5d9c60f8aa1a31a453","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T08:32:49.575837Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02372/citation-record","integrity":"/paper/2608.02372/integrity","json":"/paper/2608.02372/citation-record.json","paper":"/paper/2608.02372"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:43.743272Z","title":"Claude Haiku 4.5 System Card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:43.743272Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:d7669354e8e55ea1e559ff22a7ebafffc486e42b010b8295d3af01444a9c387a","observation_id":"504de7a3-c67a-47a9-8bcc-9fc7f327b4a1","resolution":{"observed_at":"2026-08-04T08:32:43.743272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:43.873998Z","title":"Claude Opus 4.7 System Card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:43.873998Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:9151683eb45af08085c91899946365b327c4d601e900d904ee9459faf7343ef3","observation_id":"d6651767-5d6b-4e87-9e57-7be3754334cf","resolution":{"observed_at":"2026-08-04T08:32:43.873998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-07-06T21:39:13.304260Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07982","snapshot_observed_at":"2026-08-04T08:32:43.971429Z","title":"τ 2-bench: Evaluating conversational agents in a dual-control environment, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:43.971429Z"},"links":{"cited_paper":"/paper/2506.07982","citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:b3d8ecde574903c3e8ea0f6ef7d9b35c99d360db349de2e92794360d0a84a5d5","observation_id":"cb68e588-dc12-4889-a02c-ae1a043ca196","resolution":{"observed_at":"2026-08-04T08:32:43.971429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:44.072039Z","title":"MultiWOZ - a large-scale multi-domain Wizard-of-Oz dataset for task-oriented dialogue modelling","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:44.072039Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:dc81bdf635e135bcdaff3dd1f00cc7aea7739ab9bcfe629bc8fdfe378f43e70b","observation_id":"c61c0bf5-ac1a-4ccb-8fc9-43d31a4b96a6","resolution":{"observed_at":"2026-08-04T08:32:44.072039Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:44.169178Z","title":"Timebench: A comprehensive evaluation of temporal reasoning abilities in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:44.169178Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:8a592a74c5e31aa253214fb97abae7fdcd754499407e72dd0c298c8ca2834c7c","observation_id":"e8cba22b-efea-4878-94e8-fe83925c57f7","resolution":{"observed_at":"2026-08-04T08:32:44.169178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:44.284896Z","title":"Timer: Temporal instruction modeling and evaluation for longitudinal clinical records.npj Digital Medicine, 8(1):577, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:44.284896Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:d0040944f94962aff1d39de095fe72454eb41ebbb668658ffc02b225718778ff","observation_id":"8fef0fec-1a1b-4150-a7fc-761f7621088e","resolution":{"observed_at":"2026-08-04T08:32:44.284896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:44.458523Z","title":"Deepseek-v4: Towards highly efficient million-token context intelligence, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:44.458523Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:6b083aceea4c55c73d2b5800edb3ccbdec0aff58ecf6d057f15ce51b5a5adbc0","observation_id":"b4ce5431-deca-4e9f-a547-6dd8fb684c4c","resolution":{"observed_at":"2026-08-04T08:32:44.458523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:44.629181Z","title":"Mind2web: Towards a generalist agent for the web","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:44.629181Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:d274f4c45523efa1af5a2893243b7946bd360e3a99ea4e18427a61692918cfb8","observation_id":"3cca429d-0fc0-4c08-a55c-1c4a31f629a2","resolution":{"observed_at":"2026-08-04T08:32:44.629181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:44.770225Z","title":"MultiWOZ 2.1: A consol- idated multi-domain dialogue dataset with state corrections and state tracking baselines","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:44.770225Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:f91827b27f7a4ced55c6f708cac927902eb94b50e81e06eef052aa317b8b1a29","observation_id":"8ce20688-edbe-45a7-9bb0-5f444207b151","resolution":{"observed_at":"2026-08-04T08:32:44.770225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:44.861482Z","title":"Verification of forecasts expressed in terms of probability.Monthly weather review, 78(1):1–3, 1950","venue":null,"work_id":null,"year":1950},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:44.861482Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:37f81e13ed6909e0fe97593915be894a8fb6f77eb2437eb191f57febf07bdfbe","observation_id":"72ffb4de-1d67-4d89-8d48-91273adfc39b","resolution":{"observed_at":"2026-08-04T08:32:44.861482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:45.014107Z","title":"Gemini 3 Flash Model Card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:45.014107Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:15fcd02f6496dbb5aab2e6f5c89a55327f0d829e1c136aed7daeac861b204ebe","observation_id":"00a40c3e-78a1-42fe-ac92-2c25ac880ac6","resolution":{"observed_at":"2026-08-04T08:32:45.014107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:45.136049Z","title":"Gemini 3.1 Pro Model Card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:45.136049Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:ac58f50f1d8d1b32fd34b6a2f882c46e9be79748eaf1039b55d3145cc60db338","observation_id":"a3bf996f-f749-4ae0-859c-fc4493a44e5b","resolution":{"observed_at":"2026-08-04T08:32:45.136049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:45.233219Z","title":"Weinberger","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:45.233219Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:35b98629e7303ba7dfac84897a65aad9c81b0d209f3bb10a3254ece9e1938c7b","observation_id":"b067a85c-c5c5-46a1-8cb9-b206d13a74bb","resolution":{"observed_at":"2026-08-04T08:32:45.233219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:45.318824Z","title":"Multiwoz 2.3: A multi-domain task-oriented dialogue dataset enhanced with annotation corrections and co-reference annotation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:45.318824Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:713c419e8abb3e1d3df9ccc36e2932d5f0f73d20bf13104b64b62dcb292dbcfb","observation_id":"07f4bd87-66ad-4a6f-a044-5613a91275f4","resolution":{"observed_at":"2026-08-04T08:32:45.318824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.findings-acl.378","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards explainable temporal reasoning in large language models: A structure-aware generative framework","venue":null,"work_id":"9d39d17e-bc9b-4d46-9ac9-0824c0d5b236","year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:45.449837Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:55b7f445bdb69b92725770fdd509ef973e0244607a75a474cb8392d77f11fd43","observation_id":"830417f9-cd75-43b6-afd5-a1ca3fe3b38c","resolution":{"observed_at":"2026-08-04T08:33:23.343722Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.02668","last_updated":"2026-07-14T19:09:34Z","snapshot_observed_at":"2026-08-02T16:57:38.828564Z","submitted_at":"2026-04-03T03:02:42Z","title":"Too Polite to Disagree: Understanding Sycophancy Propagation in Multi-Agent Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.02668","snapshot_observed_at":"2026-08-04T08:32:45.556145Z","title":"Too polite to disagree: Understanding sycophancy propagation in multi-agent systems.arXiv preprint arXiv:2604.02668, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:45.556145Z"},"links":{"cited_paper":"/paper/2604.02668","citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:68ada2fae9751fa4f5ae8331b7f6d40568664d2609221eacd5f7a0fc35b00134","observation_id":"08f3d5c5-c7f0-42cc-bb66-d06d2a73ae06","resolution":{"observed_at":"2026-08-04T08:32:45.556145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:45.656984Z","title":"Beyond perfect apis: A comprehensive evaluation of llm agents under real-world api complexity, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:45.656984Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:b1610143f97af995db4d694e3c3dc47a5caf97532162fd4ad95f5e5c702b0f48","observation_id":"284f6816-524c-4673-b9d1-b91056d127c5","resolution":{"observed_at":"2026-08-04T08:32:45.656984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:45.761300Z","title":"Counterfactual-consistency prompting for relative tem- poral understanding in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:45.761300Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:2ba4e6ee94910f27f2096b489dd10313129e4c88f6b1d1be9dba0e0259ea7a9e","observation_id":"2e060976-f4d5-4e0a-952c-fb79fe3dd40c","resolution":{"observed_at":"2026-08-04T08:32:45.761300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:45.875768Z","title":"Open university learning analytics dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:45.875768Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:0ec5ff911481a7edb8dd227e72c29b7c5c466e713af38e081edce6f74cb600d9","observation_id":"84088aa6-4cc8-4cc2-ac77-616a30bf0104","resolution":{"observed_at":"2026-08-04T08:32:45.875768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:45.975785Z","title":"Prefix: Understand and adapt to user preference in human-agent interaction, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:45.975785Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:2adb3d68a61e91e8678da79010d9b5d47a782fd9cf9b63b757037eef318a80fa","observation_id":"26a899b7-ad39-479d-b78e-e5d8038d5f50","resolution":{"observed_at":"2026-08-04T08:32:45.975785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.08584","last_updated":"2026-01-13T14:06:03Z","snapshot_observed_at":"2026-08-04T17:10:53.354037Z","submitted_at":"2026-01-13T14:06:03Z","title":"Ministral 3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.08584","snapshot_observed_at":"2026-08-04T08:32:46.082440Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:46.082440Z"},"links":{"cited_paper":"/paper/2601.08584","citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:a137954a5d26092529775dcb61edf579535a9a4ae3ea1417d9b41f5bda557148","observation_id":"66332d06-a20d-41c4-afb5-9cb5b9bed7b4","resolution":{"observed_at":"2026-08-04T08:32:46.082440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22919","last_updated":"2026-05-11T05:46:29Z","snapshot_observed_at":"2026-07-06T21:32:33.515702Z","submitted_at":"2025-05-28T22:43:44Z","title":"ER-Reason: A Benchmark Dataset for LLM Clinical Reasoning in the Emergency Room","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22919","snapshot_observed_at":"2026-08-04T08:32:46.218986Z","title":"Molina, and Ahmed Alaa","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:46.218986Z"},"links":{"cited_paper":"/paper/2505.22919","citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:17733156b8984ed9a233be05f0560cf4a5fb0c38f5f889fe74e4126fb801a38b","observation_id":"255100c5-8742-4475-b396-e1400a260400","resolution":{"observed_at":"2026-08-04T08:32:46.218986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:46.348786Z","title":"Mistral-Small-24B-Instruct-2501","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:46.348786Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:ab331d57189b4078ce64cb407119a33f505fc0b9d0c3d31cf5ee34fa4151337a","observation_id":"b1e86b4c-fcf0-4065-85c7-3749efa01303","resolution":{"observed_at":"2026-08-04T08:32:46.348786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:46.464972Z","title":"Time is encoded in the weights of finetuned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:46.464972Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:de2b79aa1616f2e53084edac802a8901b6a475028b6577c44c564a1023f62c4f","observation_id":"71686b62-e7c6-459a-bd70-7a6636cb7f99","resolution":{"observed_at":"2026-08-04T08:32:46.464972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:46.582534Z","title":"GPT-4o mini: Advancing cost-efficient intelligence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:46.582534Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:ab55691ddd18f5d06e60c9515a02768e31911842be6eb98db4c3b8905cf8212c","observation_id":"a706882c-f725-4e17-bd48-abea13598413","resolution":{"observed_at":"2026-08-04T08:32:46.582534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:46.659446Z","title":"Introducing GPT-5.4 mini and nano","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:46.659446Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:81f32294350ae1c26b39042a41f035b15dbfb2ab23c21ccf1f6a089c10da78ae","observation_id":"72914927-0152-422b-bfff-28cb4effaeb2","resolution":{"observed_at":"2026-08-04T08:32:46.659446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:46.815954Z","title":"GPT-5.5 System Card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:46.815954Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:572be39dca0a160ddd3546c429b6f4323c5aa48f80b3de1dc2e2dbe5b96afe8a","observation_id":"a40f4512-4bf9-4399-97a5-9c030786c193","resolution":{"observed_at":"2026-08-04T08:32:46.815954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:46.878354Z","title":"Patil, Tianjun Zhang, Xin Wang, and Joseph E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:46.878354Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:75ad07368014ec47f2e985f79b3aa718dc8864d1ecee1d0e07bb1200f4635b39","observation_id":"d3f37d3c-eed8-47bf-8043-126e87bb8ea7","resolution":{"observed_at":"2026-08-04T08:32:46.878354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:46.926362Z","title":"Gonzalez","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:46.926362Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:c8722c8576f924cf38c922b89d674240d4941954e0b270021cb2fa8715738e1f","observation_id":"e01096d4-b7c7-4943-bd83-118cb1a920f0","resolution":{"observed_at":"2026-08-04T08:32:46.926362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12860","last_updated":"2024-10-11T20:55:51Z","snapshot_observed_at":"2026-07-06T19:34:46.714277Z","submitted_at":"2024-10-11T20:55:51Z","title":"LLMD: A Large Language Model for Interpreting Longitudinal Medical Records","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12860","snapshot_observed_at":"2026-08-04T08:32:46.996990Z","title":"Llmd: A large language model for interpreting longitudinal medical records.arXiv preprint arXiv:2410.12860, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:46.996990Z"},"links":{"cited_paper":"/paper/2410.12860","citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:f4189363a095db40eb84025be0c30f21425c7d51f70c0b962e8432621478ad77","observation_id":"f5c0ab94-5970-4b58-ad47-ffba373e0c5e","resolution":{"observed_at":"2026-08-04T08:32:46.996990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:47.081849Z","title":"ToolLLM: Facilitating large language models to master 16000+ real-world APIs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:47.081849Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:65eee16d605374cc68fa228b84c3c7442765d09d95927773aa68886c7170d293","observation_id":"32d9be73-7da3-4619-8016-bb71a2b0e0db","resolution":{"observed_at":"2026-08-04T08:32:47.081849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:47.213183Z","title":"Qwen3.5: Towards native multimodal agents, February 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:47.213183Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:3fefa9463c26aeba0756818ad3e5a439c4da803c4ceccb17c55d01788d2d1e3d","observation_id":"c10d19e3-2d72-4e75-9188-f1ad4d526830","resolution":{"observed_at":"2026-08-04T08:32:47.213183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:47.333976Z","title":"Towards scalable multi-domain conversational agents: The schema-guided dialogue dataset.Proceedings of the AAAI Conference on Artificial Intelligence, 34(05):8689–8696, Apr","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:47.333976Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:ca62e14ad869e17772d3de5f854c9c021c1b3402e7e6e6f5e39bb015b206b506","observation_id":"84b448c8-e92b-47fb-af8c-57308fb56607","resolution":{"observed_at":"2026-08-04T08:32:47.333976Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:47.394889Z","title":"Appropriate reliance on ai advice: Conceptualization and the effect of explanations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:47.394889Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:a9e791dacc4450896abdf3607d076e20d708545d9295c2969dd3e0755f912920","observation_id":"e40a3819-c6ba-4e12-a8cd-b8fdf4d9aa35","resolution":{"observed_at":"2026-08-04T08:32:47.394889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:47.507523Z","title":"Timo: Towards better temporal reasoning for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:47.507523Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:fb7dff672b3ca83a4ba95fe21ce44ee72e83c01ecf8b204172ed317bb237433b","observation_id":"47de76a1-0fa2-4b7c-942f-79974f0ab4a2","resolution":{"observed_at":"2026-08-04T08:32:47.507523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:47.600137Z","title":"Paladin: Self-correcting language model agents to cure tool-failure cases, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:47.600137Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:f72e8f7d58808903328a6cedfe0e1abd23b1c42540447319c5ab1e9ce0c5d85a","observation_id":"89d6230b-03b7-4c1a-80fd-b2298631812a","resolution":{"observed_at":"2026-08-04T08:32:47.600137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:47.762337Z","title":"Agentnoisebench: Benchmarking robustness of tool-using llm agents under noisy condition, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:47.762337Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:72f49c23ba606edbc884374fd9acaf05b4e028c430433e12ca5fd8914a0fb5cc","observation_id":"47e98ff6-7aba-4a92-b24f-eb9de741ed8f","resolution":{"observed_at":"2026-08-04T08:32:47.762337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:47.874010Z","title":"Butterfly effects in toolchains: A comprehensive analysis of failed parameter filling in LLM tool-agent systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:47.874010Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:a46a75566a44e3d53b237780e59d5d29fbbe0f273878e9b0a8c280ae9d626a6c","observation_id":"b08e8d73-0612-4b52-9e9b-f23719076039","resolution":{"observed_at":"2026-08-04T08:32:47.874010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04141","last_updated":"2025-05-29T08:04:32Z","snapshot_observed_at":"2026-07-06T20:02:08.313625Z","submitted_at":"2024-12-05T13:10:54Z","title":"Reducing Tool Hallucination via Reliability Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04141","snapshot_observed_at":"2026-08-04T08:32:48.011938Z","title":"Reducing tool hallucination via reliability alignment, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:48.011938Z"},"links":{"cited_paper":"/paper/2412.04141","citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:02121fd8846aafbca30acd24be0170574340a679bc1b4dab8a648f37378e1071","observation_id":"a1028e53-6f80-4a14-af3b-5d0589a0e7ac","resolution":{"observed_at":"2026-08-04T08:32:48.011938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12307","last_updated":"2025-08-02T06:08:30Z","snapshot_observed_at":"2026-07-06T18:32:44.452493Z","submitted_at":"2024-06-18T06:28:06Z","title":"Can Tool-augmented Large Language Models be Aware of Incomplete Conditions?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12307","snapshot_observed_at":"2026-08-04T08:32:48.154098Z","title":"Can tool-augmented large language models be aware of incomplete conditions?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:48.154098Z"},"links":{"cited_paper":"/paper/2406.12307","citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:fd2d0aa35e1fafbe5bde7fa09cc370fc19e1b2057fdbc1568c78f345a615d5f7","observation_id":"a016a723-7571-439b-88df-58fd08e72c43","resolution":{"observed_at":"2026-08-04T08:32:48.154098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:48.264525Z","title":"τ-bench: A benchmark for Tool-Agent-User interaction in real-world domains","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:48.264525Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:6e44cacb6e459f1213de6946f39832bcb53d5a23a3ffb70f6011e5c462f74ac5","observation_id":"44df9c9e-d438-4cc8-9a43-8a7c522550a6","resolution":{"observed_at":"2026-08-04T08:32:48.264525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:48.388211Z","title":"MultiWOZ 2.4: A multi-domain task-oriented dialogue dataset with essential annotation corrections to improve state track- ing evaluation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:48.388211Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:873151fb3d543d2fdb7d5adecc00968e174aa2d075fa615f0a5d66a66c27fed6","observation_id":"d1d09bbd-ee5a-40d9-ade5-c71ec30779f5","resolution":{"observed_at":"2026-08-04T08:32:48.388211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:48.511445Z","title":"MultiWOZ 2.2 : A dialogue dataset with additional annotation corrections and state tracking baselines","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:48.511445Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:773871df9e29fe9263b25dbebc7e20f16ad7079a02a2f66dcfb1e3e73f212c79","observation_id":"8ff6ca94-4e10-49a4-95c4-83d46d8e6326","resolution":{"observed_at":"2026-08-04T08:32:48.511445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:48.612316Z","title":"From allies to adversaries: Manipulating LLM tool-calling through adversarial injection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:48.612316Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:d7f56f9742c719cbdcc358df6086dc1041fddb0544038494a2603364c97d7542","observation_id":"0ee22073-1f93-49c2-bb72-19f0b9bcd373","resolution":{"observed_at":"2026-08-04T08:32:48.612316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:48.760073Z","title":"CLAMBER: A benchmark of identifying and clarifying ambiguous information needs in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:48.760073Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:abfa0e231699e49c5f1781c0cdaec106c5040afd54296bf86eb54f376c55ebda","observation_id":"26473219-2caa-4716-8338-478878987eef","resolution":{"observed_at":"2026-08-04T08:32:48.760073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:48.911714Z","title":"ToolBeHonest: A multi-level hallucination diagnostic benchmark for tool-augmented large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:48.911714Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:7c5b2181e58d4c1e69cbb0829f70e3ec537e53399844c70885496854b850163d","observation_id":"b893b0a0-8e23-4c5e-b412-4f229cb1024f","resolution":{"observed_at":"2026-08-04T08:32:48.911714Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13854","last_updated":"2024-04-16T15:13:18Z","snapshot_observed_at":"2026-08-06T12:47:01.809185Z","submitted_at":"2023-07-25T22:59:32Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13854","snapshot_observed_at":"2026-08-04T08:32:49.005953Z","title":"primary driver","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:49.005953Z"},"links":{"cited_paper":"/paper/2307.13854","citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:53d84a8c4694b5c70eb519f9ba4a512f29e6f32d55014f1ab7d6d706fc8910ca","observation_id":"b7205e0c-2a3a-410a-b1b7-6f0cb03fe58f","resolution":{"observed_at":"2026-08-04T08:32:49.005953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:49.105357Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:49.105357Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:923870c4c276997c2117b6e5e17eb430066a1ae6ab84fc14954df1a567f450cf","observation_id":"ce43522e-37e3-4a92-be93-0966cec3ac4a","resolution":{"observed_at":"2026-08-04T08:32:49.105357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:49.193660Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:49.193660Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:15ed4001bba0e81f6bb0f5274c3053b2c314b145645351ed4affadf313059c8d","observation_id":"101634f9-4680-4160-80c2-014b0440f502","resolution":{"observed_at":"2026-08-04T08:32:49.193660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:49.300953Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:49.300953Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:c79664e63354fbac0c020d479a37ea44fb2e48b51f0eca1f1b9ffb576701d7be","observation_id":"998d2d4c-86fd-4029-90a9-bc50bc628c88","resolution":{"observed_at":"2026-08-04T08:32:49.300953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:49.405786Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:49.405786Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:03b0f3423ca4e364838971f3929078d1701b8ce025710d4ad2dbc06982eacff1","observation_id":"3363725e-05f2-415f-aa54-fe35f671204a","resolution":{"observed_at":"2026-08-04T08:32:49.405786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:49.476122Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:49.476122Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:13ef814168d11bdde86a2c730a2dede58a69ddccfd0370dbdcbce13ce5d4d9c7","observation_id":"69870187-8700-4e82-b1ee-fbb3c57269df","resolution":{"observed_at":"2026-08-04T08:32:49.476122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:49.575837Z","title":"Failure Risk: Critical","venue":null,"work_id":null,"year":2047},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:49.575837Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:78567cc94548c3767c3b9c1ebad5d660bb0520b33b106c0e2b67ac85ac2211f9","observation_id":"e5e5948d-c24b-4d20-a769-f1996a9946d4","resolution":{"observed_at":"2026-08-04T08:32:49.575837Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T23:37:24.968074Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":4,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2608.02372."}