{"as_of":"2026-08-14T21:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:229764537850f431185d349dcff3c420353fd679acc01340afbd11f4b5d230e7","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T04:22:04.066726Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T22:49:08.968786Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-11T22:49:09.109028Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"cited_work":{"arxiv_id":"2412.01550","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.01550","snapshot_observed_at":"2026-08-11T22:49:09.109028Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","venue":"cs.CV","work_id":"eac7759a-5e25-4024-9390-f7eb3adbe7d1","year":2024},"citing_paper":{"arxiv_id":"2412.03142","last_updated":"2025-03-20T10:03:41Z","snapshot_observed_at":"2026-08-14T13:20:36.630126Z","submitted_at":"2024-12-04T09:08:07Z","title":"AffordDP: Generalizable Diffusion Policy with Transferable Affordance","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T22:49:08.968786Z"},"links":{"cited_paper":"/paper/2412.01550","citing_paper":"/paper/2412.03142"},"observation_digest":"sha256:c69b9ccf707773b13168edf6762a2029cd2e7fcba48c2183f50bb1dcd4590f5b","observation_id":"85b2a812-ccc1-438d-bc66-f05c37773df8","resolution":{"observed_at":"2026-08-11T22:49:09.116483Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.01550/citation-record","integrity":"/paper/2412.01550/integrity","json":"/paper/2412.01550/citation-record.json","paper":"/paper/2412.01550"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T04:22:03.859307Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.859307Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:50182af60aafc74960987a3fb9d026a32c3f6e3bdbcc8b2fffd177c9916c83f0","observation_id":"ab8e3d1b-a633-4657-af7b-cea2f5bb4f09","resolution":{"observed_at":"2026-08-12T04:22:03.859307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:03.863710Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.863710Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:dd3b93c104b56f87da05ab160a0fac68eb666ccaa558f21c26f4dd36a9423228","observation_id":"a937ec8b-c65a-4d26-add7-504d835e4de8","resolution":{"observed_at":"2026-08-12T04:22:03.863710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20041","last_updated":"2025-03-04T07:37:57Z","snapshot_observed_at":"2026-08-14T02:07:12.584843Z","submitted_at":"2025-02-27T12:29:44Z","title":"3D-AffordanceLLM: Harnessing Large Language Models for Open-Vocabulary Affordance Detection in 3D Worlds","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20041","snapshot_observed_at":"2026-08-12T04:22:03.868030Z","title":"3d-affordancellm: Harnessing large language models for open-vocabulary affordance detec- tion in 3d worlds","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.868030Z"},"links":{"cited_paper":"/paper/2502.20041","citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:4d6c924b9ff2b83f12731ddf3c69df4596c8fc18ed3c300c120dd8550ce6ae86","observation_id":"fb8853da-f817-41b1-9c71-204d10ba00fc","resolution":{"observed_at":"2026-08-12T04:22:03.868030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10078","last_updated":"2025-04-05T07:55:46Z","snapshot_observed_at":"2026-08-12T22:44:16.827593Z","submitted_at":"2024-09-16T08:30:59Z","title":"3D-TAFS: A Training-free Framework for 3D Affordance Segmentation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10078","snapshot_observed_at":"2026-08-12T04:22:03.872664Z","title":"Iris: Interactive responsive intelligent segmentation for 3d affordance analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.872664Z"},"links":{"cited_paper":"/paper/2409.10078","citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:c5977201c62960a58a89202121ba87cb73032a61a9b5ed07ca3acfc82c3d7772","observation_id":"ba620139-edf7-4a7e-ab42-c056edbf3db2","resolution":{"observed_at":"2026-08-12T04:22:03.872664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.806735Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":"4065880f-b84d-4a3a-b62a-acfe04a8a305","year":2022},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.877203Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:d1ac80428aab2f60d17835281786e27cb85923e795c8ca8a694b8a6d16a2c344","observation_id":"faa3f16d-433c-414b-b3fc-4b4c039def66","resolution":{"observed_at":"2026-08-12T04:22:04.810474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.796442Z","title":"Scene- fun3d: fine-grained functionality and affordance understand- ing in 3d scenes","venue":null,"work_id":"26eb2456-1ddd-46ce-92b2-64cfa36c1893","year":2024},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.880848Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:4fb6eafc7812119a0579f80e99b311befa2e3169c0481b046f50d725c8adbbb8","observation_id":"9659b92e-b005-43ea-a0cb-c595f645da6f","resolution":{"observed_at":"2026-08-12T04:22:04.800290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.786712Z","title":"3d affordancenet: A benchmark for visual object affordance understanding","venue":null,"work_id":"38e40bde-0eef-4ca0-9547-bf0da5ab8b8c","year":2021},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.884814Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:5f130fee896366e9247e683fe6103798d345f82244b24bc50111a50d7b27465b","observation_id":"4ab097ee-b741-4d9e-aafd-71af3453c2cd","resolution":{"observed_at":"2026-08-12T04:22:04.790236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:03.888579Z","title":"Learning 2d invariant affordance knowledge for 3d affordance ground- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.888579Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:3abf79376f87d8b3f51e24a343778578e556275133ceddc9893bec5663965e28","observation_id":"ac39b2a5-e6fb-4928-bf02-2139eb936263","resolution":{"observed_at":"2026-08-12T04:22:03.888579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:03.891868Z","title":"3d-llm: Injecting the 3d world into large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.891868Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:ddfc49e744acad3f7d2538770caaa8774f0e01d1c0084c2c647f6f3a4e7bfab5","observation_id":"cf87460f-5780-472e-ac89-754453a834ab","resolution":{"observed_at":"2026-08-12T04:22:03.891868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T04:22:03.895445Z","title":"Lora: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.895445Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:28ed2936db42cd1eda5e5d066f65cfb2ae254e0814a2e39fc876fa8525a987f5","observation_id":"9797d96f-474d-4909-97fc-7b433f886771","resolution":{"observed_at":"2026-08-12T04:22:03.895445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.770398Z","title":"Robo-abc: Affordance generalization beyond categories via semantic correspondence for robot ma- nipulation","venue":null,"work_id":"ecd2905c-1fa7-4edf-88da-364d94448a76","year":2024},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.899343Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:7e4b6cbe4bff923f1061cbb63d6668cebefad8ec99749c9c163baa3ddd91127a","observation_id":"444fe85c-5a16-4e63-8f04-37f80e7cd82b","resolution":{"observed_at":"2026-08-12T04:22:04.774147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.759136Z","title":"Bert: Pre-training of deep bidirectional transform- ers for language understanding","venue":null,"work_id":"28d06971-4c10-4745-87d2-80be54f59db9","year":2019},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.903257Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:7426148ed555e6e862d6a9f5c00ea0b62087faa15dba4896d306b49191c9cdcb","observation_id":"69943d3b-05b3-4f17-ba23-39d1e283c041","resolution":{"observed_at":"2026-08-12T04:22:04.763757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:03.907546Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.907546Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:ffc59edb26aff5444feb6c683a7528f6a9ebe1ef4a0517b93d63985cf6f14673","observation_id":"eeefe02c-7f12-4951-83f5-b56c7c5e341c","resolution":{"observed_at":"2026-08-12T04:22:03.907546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.743650Z","title":"One-shot open affordance learning with foundation models","venue":null,"work_id":"88a0b36d-9eb3-45f2-acc6-256b53f8049b","year":2024},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.911800Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:3ce48739e22f31feac0cbd0ad203bc707f07241c0613970d4e9b2ae38dd2fdeb","observation_id":"adbd5ecc-11f6-4f97-90b6-493d3d0a3e6d","resolution":{"observed_at":"2026-08-12T04:22:04.746768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:03.915594Z","title":"Referring transformer: A one-step approach to multi-task visual grounding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.915594Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:b201fc08214fe58624a271f830d566dab7d89792eb55cb968cb7e0a2d28fc984","observation_id":"eeff70d7-cba7-4186-9b64-adc2f9042cdd","resolution":{"observed_at":"2026-08-12T04:22:03.915594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.726911Z","title":"Laso: Language-guided affordance seg- mentation on 3d object","venue":null,"work_id":"59d67373-0542-4fb7-bff6-c53cfb903eb1","year":2024},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.919805Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:b95b3c12942831ab127da5cf80619688214ee78dfbdc57ec3847bbe8d6a7d568","observation_id":"8bf1e2e4-155e-41fa-8f70-c34c6940b220","resolution":{"observed_at":"2026-08-12T04:22:04.730704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.715515Z","title":"Gres: Gen- eralized referring expression segmentation","venue":null,"work_id":"f4b7fb48-da38-4cb2-9f64-341d27205bc2","year":2023},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.923863Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:66900cff0e9a2614e37fb7080d3016617ffeaaa1a472692fda55562c5fa079f5","observation_id":"6bf88876-59e8-4037-9d2d-f0dde4f82d93","resolution":{"observed_at":"2026-08-12T04:22:04.719827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:03.927144Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.927144Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:420206e2b22ad06337ab8c22688cb158deb85d08922165f10387585f4bd5a415","observation_id":"49669313-8f62-4f44-adcf-60bf0c46eba9","resolution":{"observed_at":"2026-08-12T04:22:03.927144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.698467Z","title":"Openshape: Scaling up 3d shape representation towards open-world understanding","venue":null,"work_id":"f6653702-db3f-4a90-8e1f-8bdf7e8410b6","year":2024},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.930917Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:20089e2280bc6811638b45d734684c447968bde663f56f6dd4b31dedb0031eaa","observation_id":"646cfba1-47ec-4448-a8de-f6e128e61dcf","resolution":{"observed_at":"2026-08-12T04:22:04.702372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-12T04:22:03.934026Z","title":"Roberta: A robustly optimized bert pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.934026Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:1155c92ba2c93b3dbbc61ae37bb64bb6b2fda5805993b60ded5a0593bead645b","observation_id":"bae82463-d3b1-490d-90aa-0b6d388c2c04","resolution":{"observed_at":"2026-08-12T04:22:03.934026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05662","last_updated":"2023-06-02T16:19:48Z","snapshot_observed_at":"2026-08-14T04:59:13.217854Z","submitted_at":"2023-05-09T17:58:34Z","title":"InternGPT: Solving Vision-Centric Tasks by Interacting with ChatGPT Beyond Language","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05662","snapshot_observed_at":"2026-08-12T04:22:03.938006Z","title":"Interngpt: Solving vision-centric tasks by interacting with chatgpt beyond language","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.938006Z"},"links":{"cited_paper":"/paper/2305.05662","citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:2681b8920ec25b399d20f21829b29b808372049f60c6f42e828880d48bb5c22f","observation_id":"8a180739-6da4-4d7b-ba22-f36db095805f","resolution":{"observed_at":"2026-08-12T04:22:03.938006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.687217Z","title":"Auc: a misleading measure of the performance of predictive distribution models","venue":null,"work_id":"8b79f49f-d856-46c8-a879-ab14d97b3ea9","year":2008},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.941867Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:f240507db90770d58cf8a3ae7cf882c298172710543c54581628c7ea50d178e9","observation_id":"4b540fe5-7ffd-4e99-998e-1a25ac8b0bdf","resolution":{"observed_at":"2026-08-12T04:22:04.691382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-12T04:22:03.945876Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.945876Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:6545478f5f0cb57e3e9b3a326bc4172bf43ecdacbba9d50c1efa3681680edfef","observation_id":"4c78e5e9-fee6-4399-93c8-2f7dce28c78f","resolution":{"observed_at":"2026-08-12T04:22:03.945876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09511","last_updated":"2024-12-12T17:59:03Z","snapshot_observed_at":"2026-08-12T23:30:01.208412Z","submitted_at":"2024-12-12T17:59:03Z","title":"GEAL: Generalizable 3D Affordance Learning with Cross-Modal Consistency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09511","snapshot_observed_at":"2026-08-12T04:22:03.949625Z","title":"Geal: Generalizable 3d affordance learning with cross- modal consistency","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.949625Z"},"links":{"cited_paper":"/paper/2412.09511","citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:a01ed934b173c1f4216181d3ffe5e83afb6cd17011deee1cd5990a1ea26715f1","observation_id":"bf8cfec3-38cd-4bf5-b2c9-5db1fb9ca42d","resolution":{"observed_at":"2026-08-12T04:22:03.949625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.675886Z","title":"3d-sps: Single-stage 3d visual grounding via referred point progressive selection","venue":null,"work_id":"4042b677-dc06-4cce-9d8c-4a84f3a00896","year":2022},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.954442Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:e86a81132481bb3660c71a184adfe9f7a4b1f3c8064b42d6d0e52ce1c4319198","observation_id":"deef5323-929c-4b82-b5b3-8bd734e117ce","resolution":{"observed_at":"2026-08-12T04:22:04.679691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.663909Z","title":"Partnet: A large- scale benchmark for fine-grained and hierarchical part-level 3d object understanding","venue":null,"work_id":"dc91650c-245a-4788-b103-86caef2db1f8","year":2019},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.957852Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:ee9ebe9c1f99fd1d30835664e82c5c428e0beb60ebfb4fbccdaadb8dfdfb6912","observation_id":"8ffaf169-f5f0-4703-abc9-638c71c4321b","resolution":{"observed_at":"2026-08-12T04:22:04.668687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.652188Z","title":"O2o-afford: Annotation-free large-scale object- object affordance learning","venue":null,"work_id":"cb508b52-ff5d-4ac3-99a9-df5949828f08","year":2022},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.962387Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:39de2b9fd4067dabd060bce7cbc1e1c203ba970a637f45d8ed24cf7582caca1c","observation_id":"5a12ca22-527f-420c-9ecb-d9d7196c618a","resolution":{"observed_at":"2026-08-12T04:22:04.656116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02704","last_updated":"2024-11-05T01:02:51Z","snapshot_observed_at":"2026-08-12T22:07:43.974447Z","submitted_at":"2024-11-05T01:02:51Z","title":"RT-Affordance: Affordances are Versatile Intermediate Representations for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02704","snapshot_observed_at":"2026-08-12T04:22:03.966607Z","title":"Rt-affordance: Affordances are versatile intermedi- ate representations for robot manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.966607Z"},"links":{"cited_paper":"/paper/2411.02704","citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:1477a3512ea7e03be97b784eb3f98bffb06c516bf3384b4cca4ed0f1882c9840","observation_id":"d5376ed9-0cf7-4a83-a290-622e4646770e","resolution":{"observed_at":"2026-08-12T04:22:03.966607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.642393Z","title":"Open-vocabulary affordance detection in 3d point clouds","venue":null,"work_id":"846f6480-db95-48f9-b139-cf7a8e1056db","year":2023},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.971256Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:05a700d0ee8858d5baf5eefdbafa5fb523b5b285b2a1c06fa4e3fa99d03210c1","observation_id":"50671ee5-14f9-40c1-a36a-229c1c433451","resolution":{"observed_at":"2026-08-12T04:22:04.645548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.632803Z","title":"Where2explore: Few-shot affordance learning for unseen novel categories of articulated objects","venue":null,"work_id":"dbdc088b-f17a-4783-8e25-77a4190f9b3c","year":2023},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.974685Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:3a7b5a43a93bf8d543310573de6b877efb195c5cc5af063fc237e457875c4568","observation_id":"cfad631b-d865-42f1-84f1-e1ae302718c2","resolution":{"observed_at":"2026-08-12T04:22:04.636149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:03.978024Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.978024Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:875691b5fa182062d1a9d076db2d1b28fdda68a4223713702eb037a161a784a9","observation_id":"68a1afd0-09ae-4652-8a1f-3f49512cda7d","resolution":{"observed_at":"2026-08-12T04:22:03.978024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.614873Z","title":"Pointnet++: Deep hierarchical feature learning on point sets in a metric space","venue":null,"work_id":"c40d1eed-022f-48e3-a5fd-f0d7ac21f0bf","year":2017},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.981553Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:fb458cde04725a8e8ccd927a8994734e7a087342ffdb552a2ba15d0c26b54e2b","observation_id":"34129aa7-d87b-478f-b684-de823d1b2d94","resolution":{"observed_at":"2026-08-12T04:22:04.619748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.603665Z","title":"Contrast with reconstruct: Contrastive 3d representation learning guided by generative pretraining","venue":null,"work_id":"74fa579b-e58e-464b-935c-722e2c4b5965","year":2023},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.985752Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:9c9cea527cf65159818ab753d6ec94c3ad66485c194a7e3ac451b7a5f075333a","observation_id":"68c35e8d-34d8-43b9-a628-0deea8da1a67","resolution":{"observed_at":"2026-08-12T04:22:04.607948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17766","last_updated":"2024-07-12T15:36:15Z","snapshot_observed_at":"2026-08-14T03:10:34.499879Z","submitted_at":"2024-02-27T18:57:12Z","title":"ShapeLLM: Universal 3D Object Understanding for Embodied Interaction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17766","snapshot_observed_at":"2026-08-12T04:22:03.989163Z","title":"Shapellm: Universal 3d object understanding for embodied interaction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.989163Z"},"links":{"cited_paper":"/paper/2402.17766","citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:7ac61494322e7b1638d94e93344762a714d749dc4c4b85fdb31b973db16ea4b8","observation_id":"04be1169-c03b-451b-b780-fdaffc1f3d72","resolution":{"observed_at":"2026-08-12T04:22:03.989163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.593541Z","title":"Affordancellm: Grounding affordance from vision language models","venue":null,"work_id":"2e55bd74-9585-4293-af1a-fe1dc58fbc60","year":2024},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.995473Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:8f2936e85db2ce156878b186bda5fdcf35a6b8e5ad478d440c2397a1b2270cc7","observation_id":"ff3c5759-9ed8-4cc2-a132-7188a2bd74c3","resolution":{"observed_at":"2026-08-12T04:22:04.597166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:03.999478Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:03.999478Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:51736842a54fde744eae0f0f373c0215bc9fbc50fc59b17fbb12bffd0a6d3ab5","observation_id":"94cb39af-65f2-439f-9e8f-587d903f6120","resolution":{"observed_at":"2026-08-12T04:22:03.999478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.575410Z","title":"Optimizing intersection- over-union in deep neural networks for image segmentation","venue":null,"work_id":"aa6b8697-64a2-4919-a70d-9d24f5aa59bf","year":null},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:04.003391Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:8f2af7f599a5aa036df06191386636939814d576181e8754353430a2be2747d3","observation_id":"74d02153-9498-411f-a560-79a114b7f42d","resolution":{"observed_at":"2026-08-12T04:22:04.579377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19626","last_updated":"2025-03-29T03:46:58Z","snapshot_observed_at":"2026-08-14T06:58:48.506891Z","submitted_at":"2024-11-29T11:23:15Z","title":"GREAT: Geometry-Intention Collaborative Inference for Open-Vocabulary 3D Object Affordance Grounding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19626","snapshot_observed_at":"2026-08-12T04:22:04.006460Z","title":"Great: Geometry-intention collab- orative inference for open-vocabulary 3d object affordance grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:04.006460Z"},"links":{"cited_paper":"/paper/2411.19626","citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:4854417207919aef1e712362d3098610d9fbec1c5f5af5af6a2d9ecf0bacdeaf","observation_id":"47ba5652-44dd-42a8-a062-adf68c30b165","resolution":{"observed_at":"2026-08-12T04:22:04.006460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.564770Z","title":"Color indexing","venue":null,"work_id":"25c7bfc5-ceb2-4fb1-b82f-ea3f016e4ade","year":1991},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:04.009844Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:d9473d491fd9f05c6634777a654d7f16dc1519c8e2f48bf77442147fdd67d845","observation_id":"21476325-1ecd-4d30-85a7-f6deaa41a147","resolution":{"observed_at":"2026-08-12T04:22:04.568404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T04:22:04.013237Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:04.013237Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:7b1b1b4fd5b09947798f470c8a1a6a1965f04950cc373898d59dbd433a53d012","observation_id":"a00a30f4-ee81-498e-8a6d-585f8fc04bbb","resolution":{"observed_at":"2026-08-12T04:22:04.013237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.016706Z","title":"Visionllm: Large language model is also an open- ended decoder for vision-centric tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:04.016706Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:438a74ba2112f5621e2ba44ef89576916f5b784ae2d3c8d475ba96fe019fee13","observation_id":"790adcfb-82c4-43d9-9b4e-9ea0058dcc99","resolution":{"observed_at":"2026-08-12T04:22:04.016706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.546612Z","title":"Dynamic graph cnn for learning on point clouds","venue":null,"work_id":"bd151b53-82a7-4277-9f5d-8cfcbbb0d83c","year":2019},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:04.019849Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:42f23b5f5b10d7b7e2df03769541961937a85bf7a09d43713bb6f68477fd0ff0","observation_id":"d8947f22-a89c-46ae-a9a5-02726637a8f5","resolution":{"observed_at":"2026-08-12T04:22:04.550904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.536504Z","title":"Advantages of the mean absolute error (mae) over the root mean square error (rmse) in assessing average model performance","venue":null,"work_id":"0a56c84a-581f-4222-a407-286550dd574a","year":2005},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:04.023477Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:af25b4c569a82dde447c0ee11c3647d2bae9f80f31cc6b1d8eb407d8ecb34ed7","observation_id":"35681b06-9f66-45a8-b805-4fb98dd501fe","resolution":{"observed_at":"2026-08-12T04:22:04.539977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.526101Z","title":"Learning environment-aware affor- dance for 3d articulated object manipulation under occlu- sions","venue":null,"work_id":"fef16ef6-c9b9-44ca-b30d-9c4354b7ae00","year":2023},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:04.027108Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:75601354e799b481e4f8a0d1ee127013cd869555f6c3f741a68fed864aca1374","observation_id":"c05242bf-45db-48ad-9743-6e7cc79538d2","resolution":{"observed_at":"2026-08-12T04:22:04.529682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03142","last_updated":"2025-03-20T10:03:41Z","snapshot_observed_at":"2026-08-14T13:20:36.630126Z","submitted_at":"2024-12-04T09:08:07Z","title":"AffordDP: Generalizable Diffusion Policy with Transferable Affordance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03142","snapshot_observed_at":"2026-08-12T04:22:04.030516Z","title":"Afforddp: Gener- alizable diffusion policy with transferable affordance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:04.030516Z"},"links":{"cited_paper":"/paper/2412.03142","citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:2d398849a4291b65b86a651b35d33de506369c90a30bddce000cf6ec3b37d469","observation_id":"67b0b7ab-fe0e-47c4-8985-11ff6c8f4cb8","resolution":{"observed_at":"2026-08-12T04:22:04.030516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.13519","last_updated":"2022-02-28T02:58:36Z","snapshot_observed_at":"2026-08-13T16:33:18.950105Z","submitted_at":"2022-02-28T02:58:36Z","title":"PartAfford: Part-level Affordance Discovery from 3D Objects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.13519","snapshot_observed_at":"2026-08-12T04:22:04.034679Z","title":"Partafford: Part-level affordance discovery from 3d objects","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:04.034679Z"},"links":{"cited_paper":"/paper/2202.13519","citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:915abcbfe9b8970503224849393330257ae867358b4f9f1574b919026e8a2427","observation_id":"a00cb060-c011-4fa1-826a-1702af9ba9bc","resolution":{"observed_at":"2026-08-12T04:22:04.034679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.515020Z","title":"Weakly-supervised affordance grounding guided by part-level semantic priors","venue":null,"work_id":"d93e0075-bddf-4867-8dfa-6de5e583ad61","year":null},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:04.038666Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:03108156bfdc27eadeb1717845a866fee4ccc57ecef0fd61c5342d21861f3888","observation_id":"f78edc63-97e3-40f5-8742-2c85b156b9a5","resolution":{"observed_at":"2026-08-12T04:22:04.518779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16911","last_updated":"2024-09-06T22:45:43Z","snapshot_observed_at":"2026-08-13T10:23:06.063904Z","submitted_at":"2023-08-31T17:59:46Z","title":"PointLLM: Empowering Large Language Models to Understand Point Clouds","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16911","snapshot_observed_at":"2026-08-12T04:22:04.042646Z","title":"PointLLM: Empowering large language models to understand point clouds","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:04.042646Z"},"links":{"cited_paper":"/paper/2308.16911","citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:405b4bd2fc8f5eec99955e698a388f3225bb0a01882212619d93f839e5a77949","observation_id":"41a64d97-2b2f-4ee0-a5ce-84dfd9281f06","resolution":{"observed_at":"2026-08-12T04:22:04.042646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.504286Z","title":"Ulip: Learning a unified representation of language, images, and point clouds for 3d understanding","venue":null,"work_id":"c2d78c1f-185d-404f-bf91-6e0dfb76c0e2","year":2023},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:04.046371Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:b8bda1f7ea7d7a42571049301b663dd7b0f30eb31832d91c4ac4dae19c859017","observation_id":"23d12af1-3457-46e9-84a6-21082957c3d2","resolution":{"observed_at":"2026-08-12T04:22:04.508196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.493077Z","title":"Grounding 3d object affordance from 2d interactions in images","venue":null,"work_id":"e68ea97d-9539-4816-bd7a-4a30b557d67a","year":2023},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:04.049340Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:590a937bc48e6cdd6df3986e8768099812073dbdc5d2d4e9356e230bee7d23be","observation_id":"44b14df7-2f30-471e-bc22-79e192377a99","resolution":{"observed_at":"2026-08-12T04:22:04.496613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.482506Z","title":"Lemon: Learning 3d human-object interac- tion relation from 2d images","venue":null,"work_id":"0a28501a-fcb5-4333-a17f-ba8dc4299a4c","year":2024},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:04.052564Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:2384bc0701c2160ef84f43517710a8157620592851d8b31fc463fce145321877","observation_id":"46b23a12-9091-4d5a-b482-5f9e51f2648a","resolution":{"observed_at":"2026-08-12T04:22:04.486321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-08-12T17:07:18.793418Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-12T04:22:04.055997Z","title":"Ferret: Refer and ground anything anywhere at any granularity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:04.055997Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:0882e56de040c603fde7353bd22cf9c9d0dea1837f175e3cb3f635712ec58b16","observation_id":"f69d034d-0738-4355-993f-2de9a35a7dec","resolution":{"observed_at":"2026-08-12T04:22:04.055997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:22:04.470665Z","title":"Uni3d: A unified baseline for multi-dataset 3d object detection","venue":null,"work_id":"5f37035a-96e7-4460-915e-8deae4a11542","year":2023},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:04.059689Z"},"links":{"citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:6e74af344a4e8fdd6fcbe65a9640744278dedf02cbfaa2d89f6f26e3967dcbc3","observation_id":"63edb73d-6da7-4125-9340-83cc90a7a3c0","resolution":{"observed_at":"2026-08-12T04:22:04.475924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03601","last_updated":"2025-06-12T00:15:18Z","snapshot_observed_at":"2026-08-13T11:00:14.993256Z","submitted_at":"2023-07-07T13:43:44Z","title":"GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03601","snapshot_observed_at":"2026-08-12T04:22:04.063177Z","title":"Gpt4roi: Instruction tuning large language model on region- of-interest","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:04.063177Z"},"links":{"cited_paper":"/paper/2307.03601","citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:11b84caa287bb04b835458e718b005c49f5ecf10c4318acc96363c2e21426ad8","observation_id":"a846904f-5e78-4b50-b971-f9ef41629ef4","resolution":{"observed_at":"2026-08-12T04:22:04.063177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-12T04:22:04.066726Z","title":"B.2. Task In the task module, we have preset the textual Prompt template as follows:","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:04.066726Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.01550"},"observation_digest":"sha256:6e50563bcaa54c9b25662740d0cd27c3865ec34e574fd78ff0a53c4f863bf967","observation_id":"cb685245-b92f-4eb9-a991-16602a54c21e","resolution":{"observed_at":"2026-08-12T04:22:04.066726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.01550","last_updated":"2025-03-21T04:31:01Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T12:26:56.549584Z","submitted_at":"2024-12-02T14:37:57Z","title":"SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2412.01550."}