{"as_of":"2026-08-08T11:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:22dbe8f7c9b35c4e987894ff4a3337396972fcac2c2ef37038a9fb2ef1d6d945","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T11:40:45.128896Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.02324/citation-record","integrity":"/paper/2509.02324/integrity","json":"/paper/2509.02324/citation-record.json","paper":"/paper/2509.02324"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:49.068150Z","title":"Embodied large language models enable robots to complete complex tasks in unpredictable environments,","venue":null,"work_id":"b59fd90e-54b9-4302-9991-8bb628e5ba99","year":2025},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:41.025467Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:6048ec7153c606f79ff3f9b3595c6d2c36d0ad112109bece0e4ad5aa724bea3f","observation_id":"9d5c7bf2-c8e6-4b3f-ae03-a97f2bda7716","resolution":{"observed_at":"2026-08-05T11:40:49.070769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:49.059799Z","title":"A grasping-centered analysis for cloth manipulation,","venue":null,"work_id":"59fd7932-61ff-4bcd-8666-07834a747bd0","year":2020},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:41.076497Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:d7d6147d632ce050f1ac1fdc28b21f0f1fb1809fefc09887bb17fd43d184df08","observation_id":"38631c8e-16f6-4c9e-bd39-ebf1507706b0","resolution":{"observed_at":"2026-08-05T11:40:49.062757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:49.051333Z","title":"Equivact: Sim(3)-equivariant visuomotor policies beyond rigid object manipulation,","venue":null,"work_id":"a9d258d5-92d6-480d-bcc5-9568d3c1d182","year":2024},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:41.182254Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:aee5451888310c6c90d74d0264355359964f7fd8ee5d1d85a0ab98fe8609e42e","observation_id":"8db76c9a-2645-433b-95f1-cd09da205e3b","resolution":{"observed_at":"2026-08-05T11:40:49.054334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:49.043949Z","title":"Tactilealoha: Learning bimanual manipulation with tactile sensing,","venue":null,"work_id":"6c3c177f-bf6c-460f-ba0b-5efe85a909ef","year":2025},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:41.287219Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:23a4881450a1981d4fe17c711c410870f348d071d06f70fc1c2c3ed55bd07cb7","observation_id":"0fda5ba3-52f5-4969-9739-a2d2876871d5","resolution":{"observed_at":"2026-08-05T11:40:49.046485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:49.036301Z","title":"Unigarmentmanip: A unified framework for category-level garment manipulation via dense visual correspondence,","venue":null,"work_id":"cfadf347-5820-4bbb-8c7f-2a32ba395a45","year":2024},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:41.392603Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:cf40faf5c33ac4af43095d45fc9b2601998f6d9afdf6492044b0c71ddd9710c8","observation_id":"f19c4b3e-d36f-4c55-a540-d1f009ddcfdb","resolution":{"observed_at":"2026-08-05T11:40:49.039021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:41.576199Z","title":"Soundmind: Rl-incentivized logic reasoning for audio-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:41.576199Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:1ed5ff060223b21a14e91fd0be70e7186ca5488b08c537b8572a63b8cccf84e2","observation_id":"18d82ffe-0611-4be0-98ab-89cd6df2a741","resolution":{"observed_at":"2026-08-05T11:40:41.576199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:49.028166Z","title":"Encoder: Entity mining and modification relation binding for composed image retrieval,","venue":null,"work_id":"af69e275-fd79-4bcc-afae-033ecf2a1a87","year":2025},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:41.726092Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:a0f2bd13e3c69a0a43ad9a313ffe98d4dd715d31db5f461586b22639b7e58716","observation_id":"9f70c2c8-0b37-4d5d-9ce7-c7332f99a837","resolution":{"observed_at":"2026-08-05T11:40:49.031033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:49.020419Z","title":"Cliport: What and where pathways for robotic manipulation,","venue":null,"work_id":"fac71659-590d-4820-a890-05515ce7b12f","year":2022},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:41.871655Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:b03e3fddf3593f858fc937413456f3a4f843ef8e738821fe4d6e760df28cbfc3","observation_id":"1b6b14ce-aff7-4d74-bb62-06c17d0704c0","resolution":{"observed_at":"2026-08-05T11:40:49.023326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:41.973613Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:41.973613Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:5bc0762603672e4d0ced0a31169b708d6873c3625617ae83a018740485ce22cc","observation_id":"28badebb-97e0-4d96-b8dc-820466e24664","resolution":{"observed_at":"2026-08-05T11:40:41.973613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:48.886580Z","title":"Vision-language foundation models as effective robot imitators,","venue":null,"work_id":"024fea5b-2ebb-4043-99cd-80eb5071b94a","year":2024},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:42.085270Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:dfece63695641f690596139ea7cd8ab12d2618d8a37fafde1a6066264da23e16","observation_id":"65f6836c-f3e7-452f-9e78-3c2d4574e2b2","resolution":{"observed_at":"2026-08-05T11:40:48.969797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:48.685118Z","title":"Generalizable clothes manipulation with large language model,","venue":null,"work_id":"f6f4c6d8-9e0b-4653-afae-6c6832a0cb44","year":2024},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:42.225874Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:08a594aba6ff9169abb4ff28023445531a3b25fc4929369db43f152801345536","observation_id":"2af541b2-c982-4691-98c4-50e74b70d39d","resolution":{"observed_at":"2026-08-05T11:40:48.802449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16458","last_updated":"2025-06-16T09:20:38Z","snapshot_observed_at":"2026-07-06T20:27:00.165620Z","submitted_at":"2025-01-27T19:37:18Z","title":"BiFold: Bimanual Cloth Folding with Language Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16458","snapshot_observed_at":"2026-08-05T11:40:42.340587Z","title":"Bifold: Bimanual cloth folding with language guidance,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:42.340587Z"},"links":{"cited_paper":"/paper/2501.16458","citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:5353021393ec08b3cb89c93a605e53216863ae09d96d21fc916cfca118d6cb23","observation_id":"edda266b-b85e-4387-ab2d-0c2891beccfa","resolution":{"observed_at":"2026-08-05T11:40:42.340587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:48.450047Z","title":"Lip-llm: Inte- grating linear programming and dependency graph with large language models for multi-robot task planning,","venue":null,"work_id":"c7c7f180-5380-484f-8ff1-3998fa267c0e","year":2024},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:42.471441Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:866af9d8b6be32411cabd61b7dd376b541ac236e604e3412cc8f2d061719cc03","observation_id":"64ef59b9-ec2a-44f2-ab04-e0c834f85629","resolution":{"observed_at":"2026-08-05T11:40:48.565674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14744","last_updated":"2025-06-23T06:11:32Z","snapshot_observed_at":"2026-08-07T18:01:22.772663Z","submitted_at":"2025-02-20T17:14:34Z","title":"HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14744","snapshot_observed_at":"2026-08-05T11:40:42.538039Z","title":"Hiddendetect: Detecting jailbreak attacks against large vision-language models via monitoring hidden states,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:42.538039Z"},"links":{"cited_paper":"/paper/2502.14744","citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:2721335b48122655e049757cddd6af87fc897ca5d8e366a627d2305978f79d81","observation_id":"7695229e-18a4-4341-b165-aed5a3105201","resolution":{"observed_at":"2026-08-05T11:40:42.538039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12359","last_updated":"2025-01-07T15:36:54Z","snapshot_observed_at":"2026-07-06T20:08:12.033767Z","submitted_at":"2024-12-16T21:14:11Z","title":"LLaVA Steering: Visual Instruction Tuning with 500x Fewer Parameters through Modality Linear Representation-Steering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12359","snapshot_observed_at":"2026-08-05T11:40:42.595711Z","title":"Llava steering: Visual instruction tuning with 500x fewer parame- ters through modality linear representation-steering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:42.595711Z"},"links":{"cited_paper":"/paper/2412.12359","citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:ce3cdb5bc465c2e2a2df3d04c4529fb682b45b44b833f376cfbfb0b676177166","observation_id":"a86b237e-fcad-4b05-9bbf-c785ed44eb99","resolution":{"observed_at":"2026-08-05T11:40:42.595711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06020","last_updated":"2025-02-09T20:26:30Z","snapshot_observed_at":"2026-07-06T20:33:39.014448Z","submitted_at":"2025-02-09T20:26:30Z","title":"Temporal Working Memory: Query-Guided Segment Refinement for Enhanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06020","snapshot_observed_at":"2026-08-05T11:40:42.676909Z","title":"Temporal working memory: Query-guided segment re- finement for enhanced multimodal understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:42.676909Z"},"links":{"cited_paper":"/paper/2502.06020","citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:8c5a175fa109dacd8b98c613c7b015aff2a6a9f51a0b4a293b9feadfffc71116","observation_id":"0156f84b-e68e-4724-b256-7f155f5145a3","resolution":{"observed_at":"2026-08-05T11:40:42.676909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21309","last_updated":"2025-03-27T09:34:21Z","snapshot_observed_at":"2026-08-07T16:33:24.726393Z","submitted_at":"2025-03-27T09:34:21Z","title":"FineCIR: Explicit Parsing of Fine-Grained Modification Semantics for Composed Image Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21309","snapshot_observed_at":"2026-08-05T11:40:42.737866Z","title":"Finecir: Explicit parsing of fine-grained modification semantics for composed image retrieval,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:42.737866Z"},"links":{"cited_paper":"/paper/2503.21309","citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:f51020b9c97ca84e66006a82649843ae320cbf12e604477b4ba91436b679e3c1","observation_id":"589aa30c-c597-4843-866a-99dbbcac6474","resolution":{"observed_at":"2026-08-05T11:40:42.737866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-05T11:40:42.819449Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:42.819449Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:5fc064208e47577e656ae12359f76dfdf13a4fabd065911a378562b0fb261ce0","observation_id":"a9cca33f-fb47-4e89-b3df-3bf662e3989b","resolution":{"observed_at":"2026-08-05T11:40:42.819449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:48.209833Z","title":"Dora: Weight-decomposed low-rank adap- tation,","venue":null,"work_id":"2a6ed280-7541-49a8-88fe-a85955a7344a","year":2024},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:42.887484Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:09920d823ee5db0cd99476741e7f1baa8cf1251d3b910f6e399933b5dafbca1e","observation_id":"63fa372b-88c3-4406-9950-63c1875f720a","resolution":{"observed_at":"2026-08-05T11:40:48.323190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:47.974553Z","title":"Mmap: Multi-modal alignment prompt for cross-domain multi-task learning,","venue":null,"work_id":"e218d042-0605-4240-88bd-82174226d6a7","year":2024},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:42.994541Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:e92141ee1af736f98881a93437b03ffb544b27596667a8e2209959437e0855aa","observation_id":"01a11831-5929-4799-98b4-45a379a88e32","resolution":{"observed_at":"2026-08-05T11:40:48.088669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:47.754844Z","title":"Gaussiangrasper: 3d language gaussian splatting for open-vocabulary robotic grasping,","venue":null,"work_id":"10dfd93b-7ec2-4cfc-bc21-9e6d030547d2","year":2024},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:43.067617Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:e9aeb3ec83a26a228ce7994b01815a0640ef1a8c4db3db1eea0bae704ab1a74d","observation_id":"1f8f3d30-3277-4ff9-86f1-f114f8581210","resolution":{"observed_at":"2026-08-05T11:40:47.865718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:47.502877Z","title":"Tinyvla: Towards fast, data-efficient vision-language- action models for robotic manipulation,","venue":null,"work_id":"e28d4d40-db02-4540-b47c-4d0e9d002807","year":2025},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:43.123497Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:21bf9683818bc48e3c8553b3bbb666e810a940ae156da19eb63c1191e51a6a41","observation_id":"1b8132bb-e569-4708-abca-05823224e93c","resolution":{"observed_at":"2026-08-05T11:40:47.619566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:47.359134Z","title":"Naturalvlm: Leveraging fine-grained natural language for affordance-guided visual manipula- tion,","venue":null,"work_id":"7bbe76df-5828-43c6-94b1-d465506e9ebb","year":2024},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:43.202113Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:4c3656c4838916eea781e4526e25a50b92e01301a6fffc080c19161218b7e017","observation_id":"b198b6ef-4278-4ade-8b90-4dadaed7709f","resolution":{"observed_at":"2026-08-05T11:40:47.438022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:43.310770Z","title":"Screencoder: Advancing visual-to-code generation for front- end automation via modular multimodal agents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:43.310770Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:2caa3adbc80a05ab2c73716d28c91d9905b170d99d921bbbe2cf273f6b91cc05","observation_id":"2695136e-78f7-4f1e-b224-25cce432e631","resolution":{"observed_at":"2026-08-05T11:40:43.310770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12119","last_updated":"2026-05-29T11:31:58Z","snapshot_observed_at":"2026-08-07T18:11:25.128924Z","submitted_at":"2025-02-17T18:43:41Z","title":"PRISM: Self-Pruning Intrinsic Selection Method for Training-Free Multimodal Data Selection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12119","snapshot_observed_at":"2026-08-05T11:40:43.383519Z","title":"Prism: Self-pruning intrinsic selection method for training-free multimodal data selection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:43.383519Z"},"links":{"cited_paper":"/paper/2502.12119","citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:d199e479343a9e71d832d73f521fa1e4d64ca9e806331c2fd88a62ad760ca343","observation_id":"7af4c5d3-9659-4280-a923-77fbc81b99bf","resolution":{"observed_at":"2026-08-05T11:40:43.383519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04557","last_updated":"2025-03-06T15:49:16Z","snapshot_observed_at":"2026-08-07T17:24:20.782375Z","submitted_at":"2025-03-06T15:49:16Z","title":"Learning Generalizable Language-Conditioned Cloth Manipulation from Long Demonstrations","version":1},"cited_work":{"arxiv_id":"2503.04557","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.04557","snapshot_observed_at":"2026-08-05T11:40:45.244841Z","title":"Learning Generalizable Language-Conditioned Cloth Manipulation from Long Demonstrations","venue":"cs.RO","work_id":"7a611361-8ccd-4f85-b1a9-b3ea8e91fa81","year":2025},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:43.455554Z"},"links":{"cited_paper":"/paper/2503.04557","citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:b51e7d45e8bd7992237f619d0d0fcd9c19c31576451bb05fb3f8d2212c6044f8","observation_id":"1e1ebe34-fa3b-4b3c-8240-058ccc67a16c","resolution":{"observed_at":"2026-08-05T11:40:45.297774Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:47.228091Z","title":"Language-guided dexterous functional grasping by llm generated grasp functionality and synergy for humanoid manipulation,","venue":null,"work_id":"94e5a795-cb0e-4e41-96d4-776b6c5e445d","year":2025},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:43.533204Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:bfeca86e22143fe7ac0b6c562fcff29751e7d5f0170fb136d53ad2dcb3d93cf6","observation_id":"9db73f75-d90b-4014-abfe-8693bc6146bb","resolution":{"observed_at":"2026-08-05T11:40:47.289231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:43.607301Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:43.607301Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:6fd50f79aadae76befe7a4b6424b9a49754745655da637e3b0850ae0aaeaebdf","observation_id":"c558af5d-14ee-4583-9c53-d3609ffda091","resolution":{"observed_at":"2026-08-05T11:40:43.607301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:43.684198Z","title":"Text2motion: From natural language instructions to feasible plans,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:43.684198Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:645087472da4249b9ad73c87b1d45d9239c472878f155280a7d0ba58baf377b3","observation_id":"526cd251-61ee-4f02-9f58-00c8012e0f18","resolution":{"observed_at":"2026-08-05T11:40:43.684198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:47.035101Z","title":"Learning to follow and generate instructions for language-capable navigation,","venue":null,"work_id":"bcb69d74-beb8-4a93-8b4d-21ecd0a1e8a7","year":2023},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:43.766721Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:e4a5e749dcfd3c9f0da8deddd5b093601e030aba93367a5717868407052b580c","observation_id":"bdf66df0-e8bf-48d5-83a5-3ad6bdf3e3af","resolution":{"observed_at":"2026-08-05T11:40:47.115567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:46.847581Z","title":"Mesh-based dynamics with occlusion reasoning for cloth manipulation,","venue":null,"work_id":"81d0bb5f-9eca-4b23-bff5-59715b0c82b8","year":2022},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:43.865854Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:b26b6d50776c0941c0c822ceffe825969affabdadf654cbd38d6c0a952c03db1","observation_id":"5f8198f8-2417-4ebc-a686-8ed9717cdb35","resolution":{"observed_at":"2026-08-05T11:40:46.930951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:46.742834Z","title":"Differentiable cloth parameter identification and state estimation in manipulation,","venue":null,"work_id":"517ad980-22ba-4b14-8064-7a247bd95e68","year":2024},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:43.933712Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:245bebe3d0dc97af7d2beb5e44e7235d86ff22370b8c2179448e5ea89e8b108f","observation_id":"1360d589-fe5e-4901-b50f-5454988ee3d9","resolution":{"observed_at":"2026-08-05T11:40:46.803164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:46.626392Z","title":"Imitating tool-based garment folding from a single visual observation using hand-object graph dynamics,","venue":null,"work_id":"7a6245ad-f3bd-4f81-9375-9be9b255a634","year":2024},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:44.006689Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:f052f649ea322494aecb9888e63d182e56ad189e5c99a6c4f4ebb9a97d85cd49","observation_id":"8aeca3f9-204b-4656-b866-1e1be93f4dac","resolution":{"observed_at":"2026-08-05T11:40:46.686407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:46.489099Z","title":"Folding clothes autonomously: A complete pipeline,","venue":null,"work_id":"96fec97d-c664-4de8-b428-0b2f81e8c76e","year":2016},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:44.087387Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:9daf46852fe7e2b25edd6f2c8d7e6ef94ae1ee73e10bd50ce4bf1fbc94fbd88b","observation_id":"681734b0-f281-4799-9163-279cc1993534","resolution":{"observed_at":"2026-08-05T11:40:46.560103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:46.339066Z","title":"Rl-vlm-f: reinforcement learning from vision language foundation model feedback,","venue":null,"work_id":"e9624d40-9d1e-4b6b-af81-8b5ecf1cf2c1","year":2024},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:44.152175Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:cc039853bba5813540b1a02039a301de088682472069cc20694ed5e0b10fec36","observation_id":"0fea887e-a1f6-45ae-ac02-e6f2c031243d","resolution":{"observed_at":"2026-08-05T11:40:46.416742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11999","last_updated":"2025-08-29T22:59:16Z","snapshot_observed_at":"2026-08-07T17:02:25.349153Z","submitted_at":"2025-03-15T05:34:26Z","title":"Diffusion Dynamics Models with Generative State Estimation for Cloth Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11999","snapshot_observed_at":"2026-08-05T11:40:44.238198Z","title":"Diffusion dynamics models with generative state estimation for cloth manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:44.238198Z"},"links":{"cited_paper":"/paper/2503.11999","citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:913e41ba77b1d00f4e7e017901ceb467e41376ab6eb100cd9697c7c3b0d3146e","observation_id":"5ddd2113-93fc-4832-af08-fa988c698a65","resolution":{"observed_at":"2026-08-05T11:40:44.238198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08372","last_updated":"2025-08-13T11:56:17Z","snapshot_observed_at":"2026-08-07T17:13:08.530773Z","submitted_at":"2025-03-11T12:30:21Z","title":"MetaFold: Language-Guided Multi-Category Garment Folding Framework via Trajectory Generation and Foundation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08372","snapshot_observed_at":"2026-08-05T11:40:44.324506Z","title":"Metafold: Language-guided multi-category garment fold- ing framework via trajectory generation and foundation model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:44.324506Z"},"links":{"cited_paper":"/paper/2503.08372","citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:53bedd533fb5abd4f7188092c651af3deb2718ccd3d9febb865a978c328c9a18","observation_id":"f439d071-9e37-4c29-ade9-b89a71bbb322","resolution":{"observed_at":"2026-08-05T11:40:44.324506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:46.210557Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection,","venue":null,"work_id":"f8a4374a-5a4b-4bf7-9161-a9ef013a9318","year":2024},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:44.411045Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:1ecd18ace935439ddc7c531a743029fdd6f5777ea49ed6723e6a2e74ea03ecb9","observation_id":"899f2e4c-01c3-4304-a9e5-ce8be051e4ad","resolution":{"observed_at":"2026-08-05T11:40:46.251222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:44.498338Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:44.498338Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:7d6c17c35fc784ba91c89bfd1144fe234f562eb7ee1dc29ae907d6b83cd1cc9b","observation_id":"20b30824-e636-4454-a335-0c50a5b5c67d","resolution":{"observed_at":"2026-08-05T11:40:44.498338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:44.573359Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:44.573359Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:2196cfa3919743b1d554a00e5d7743593ebab433174ce3cb2bbcc31803f1ef91","observation_id":"8a044604-0959-4f74-b06c-44cf5c5e0377","resolution":{"observed_at":"2026-08-05T11:40:44.573359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:44.657750Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:44.657750Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:f29f7f0e7e3455c2ba2cd5509a28cb658ad516122c0d133493a9f90d3633d98c","observation_id":"f079ca0e-1e91-468c-a09b-eac465c878bb","resolution":{"observed_at":"2026-08-05T11:40:44.657750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:46.049768Z","title":"Softgym: Benchmarking deep reinforcement learning for deformable object manipulation,","venue":null,"work_id":"ba4f4082-6de2-4542-9a2c-6c9bbac97630","year":2021},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:44.712292Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:056ea2642db007e0cad9c979e2bb8fde5311d3bc0ea78711515a4662af702643","observation_id":"852fb586-c70f-4303-b304-2cb2ce8ddcea","resolution":{"observed_at":"2026-08-05T11:40:46.134909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:45.838729Z","title":"LoRA: Low-rank adaptation of large language models,","venue":null,"work_id":"1f5693c3-b6b0-4199-b40f-c10c0a3a2161","year":2022},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:44.781667Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:97c8b40fc13803ac2d1180bfac3769d4b0c226bcea9e209902f80bff0ac15add","observation_id":"a4ade26b-0b4b-4140-af57-b13393ad2e1d","resolution":{"observed_at":"2026-08-05T11:40:45.927269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:44.846548Z","title":"Few-shot parameter-efficient fine-tuning is better and cheaper than in-context learning,","venue":null,"work_id":null,"year":1950},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:44.846548Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:fb96e0407ae1cc24c23130d025e787bd5098dce7a31f52b5cfe39a4452106133","observation_id":"c432d1f6-0452-4ce4-a1cc-f6fc24e2b902","resolution":{"observed_at":"2026-08-05T11:40:44.846548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:45.690598Z","title":"Doubao-1.5-pro,","venue":null,"work_id":"184c0b9d-4773-4220-ae81-f409b8ccb7e5","year":2025},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:44.909106Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:8d58d1d0e1498778ad08c52bb9ec7c8c151e28a427197ac9c86d0ecc4c544cb9","observation_id":"4418ac33-592b-401c-b9cc-7ea9524be27e","resolution":{"observed_at":"2026-08-05T11:40:45.772883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:40:45.557936Z","title":"Grok 3: Advancing real-time reasoning in AI,","venue":null,"work_id":"dfd08962-e3d9-4bdf-a281-c8fd71b8f154","year":2025},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:44.972085Z"},"links":{"citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:ed84d3b5285eb3a9a0d596832e472a0473bacad12a1d6b2ffdc746024f06034d","observation_id":"f00ed245-a3d8-4440-9cc4-e666bd752549","resolution":{"observed_at":"2026-08-05T11:40:45.618650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-05T11:40:45.045261Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:45.045261Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:d29a8379a6afd9644af2589a128cc86e0bb28f18e87c7863e7d921927d9c459a","observation_id":"dceae648-02f1-4a6e-959f-e67d991e77c9","resolution":{"observed_at":"2026-08-05T11:40:45.045261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T11:40:45.128896Z","title":"Gpt-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T11:40:45.128896Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2509.02324"},"observation_digest":"sha256:b2c2aa58b9b0f2f73b84dac9b6c8ef853a2b1834349fe019651c3d1b35e65fa9","observation_id":"e1babadc-91cf-44bf-8608-83408c95b000","resolution":{"observed_at":"2026-08-05T11:40:45.128896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.02324","last_updated":"2025-09-02T13:50:45Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T18:08:02.522629Z","submitted_at":"2025-09-02T13:50:45Z","title":"Language-Guided Long Horizon Manipulation with LLM-based Planning and Visual Perception"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":1,"verified_fuzzy":27},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2509.02324."}