{"as_of":"2026-08-18T23:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:64f1cd36ec57c54030d20abb8470e3a7c431559cf1540d98ce4f0970b252bec8","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:32:25.265609Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.23734/citation-record","integrity":"/paper/2507.23734/integrity","json":"/paper/2507.23734/citation-record.json","paper":"/paper/2507.23734"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:26.225446Z","title":"CVGIP: Image Understanding, 1994","venue":null,"work_id":"c1adc6ba-5912-4d7b-b4f1-71579be6ebf2","year":1994},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:24.986419Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:acb0c54518b753b4b133ca5dc30fcd927d20959c429114eaf4a53303b7284ade","observation_id":"a02b68eb-28f2-4cf0-94d8-9edce78dfcf0","resolution":{"observed_at":"2026-08-06T10:32:26.230725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T10:32:24.990678Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:24.990678Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:8a807a38fd4521f74c89ce06051089184722e3b5cf4d50a3b4e1f27b1d874bde","observation_id":"d187644f-1afb-447b-b459-7f038b942b02","resolution":{"observed_at":"2026-08-06T10:32:24.990678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:26.213783Z","title":"Affordances from human videos as a versa- tile representation for robotics","venue":null,"work_id":"8d33e78e-3fb5-4912-80b8-412fe768f6c2","year":2023},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:24.994960Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:a55cd61f1219a415bb99fef48a595aa5abf80920689f78b9c37e46d200409288","observation_id":"8720acd0-0d0b-4fe0-b3b9-0345da2cdae8","resolution":{"observed_at":"2026-08-06T10:32:26.216995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-06T10:32:24.998970Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:24.998970Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:c53336874d1375c109ab7d2d63364dec6f2336d19403feddf7107f7bdc4a0e57","observation_id":"c46679f7-37f1-4b2d-8ed0-7af06408f937","resolution":{"observed_at":"2026-08-06T10:32:24.998970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:26.203918Z","title":"Coco- stuff: Thing and stuff classes in context","venue":null,"work_id":"528c25ec-4cab-457e-a2b7-5a3a47d5ff16","year":2018},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.003931Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:9fd6895680d3aea9ca565bd0c03fd0279b7cfa9a977b71394ea8fae70ab3dedb","observation_id":"d7799735-52f9-4122-ab32-7c17f39395c6","resolution":{"observed_at":"2026-08-06T10:32:26.206717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:26.193870Z","title":"Affordance grounding from demonstration video to target image","venue":null,"work_id":"f73ac8e5-bfe7-4242-8ed4-051286929b35","year":2023},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.008876Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:7e378a411a2c4ea4f707374870cbd143089b7460708c18e54ccae2a46938df80","observation_id":"0e8e39ce-4141-4ecf-b16f-06eb77082bc7","resolution":{"observed_at":"2026-08-06T10:32:26.196815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:26.183762Z","title":"Learning to act properly: Predicting and explaining affordances from images","venue":null,"work_id":"d791b1f9-cb86-40f1-ab6b-3653dbefe9a3","year":2018},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.012877Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:1bd140d609d426103141e9e20c50067432cad5c03916d105dc7155ccd586b7e3","observation_id":"0ef1dfe8-774a-4398-a427-9b9917c01ab4","resolution":{"observed_at":"2026-08-06T10:32:26.186795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:26.172608Z","title":"Rescaling egocentric vision: Collection, pipeline and chal- lenges for epic-kitchens-100","venue":null,"work_id":"0f968be9-ee38-4481-8fef-6cf4b5fd57df","year":2022},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.016814Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:010e17988ba68b77c6b3f1046849fd88bfd59061dafcf7743f6792e564b5d6d0","observation_id":"6aa0fa14-1dd6-41f8-a0df-7d9dab3504ee","resolution":{"observed_at":"2026-08-06T10:32:26.176270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:26.161570Z","title":"Affordancenet: An end-to-end deep learning approach for object affordance detection","venue":null,"work_id":"4ad556f9-fd3b-4ea2-86cb-533bc7f30076","year":2018},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.020699Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:cc3d0b5a68947cc734f55bd90efa805fec2a678b34151d09a01493c16f26a130","observation_id":"91a25caa-4faf-4968-9885-bf71bb8a718b","resolution":{"observed_at":"2026-08-06T10:32:26.164695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:26.151344Z","title":"Graspnet-1billion: A large-scale benchmark for general ob- ject grasping","venue":null,"work_id":"56520190-7d6c-4644-8fd8-a1bcf016ab22","year":2020},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.024273Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:e74099322d71f6906c5d4031ae0ccccd291464868e78d433ed9d094f00a95091","observation_id":"10e9dc6e-2c4d-4067-8a3c-a3a265093bc6","resolution":{"observed_at":"2026-08-06T10:32:26.154261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:26.141973Z","title":"Demo2vec: Reasoning object affordances from online videos","venue":null,"work_id":"ce0a06f7-aebd-4481-8d99-bdab1352f19b","year":2018},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.027663Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:8fd2dea78e4f302a0e788fd019b604d496fb30a33bc51005382e44712c47e024","observation_id":"ea9c919c-b587-4039-b4af-4734de01b46e","resolution":{"observed_at":"2026-08-06T10:32:26.145144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:26.130946Z","title":"Learning visual at- tributes","venue":null,"work_id":"f6c5dd1b-0d5e-4096-a258-b7c9c4f200ba","year":2007},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.031834Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:c95d27bad70731b60623bca1e5c0fdf36358a840874419728b45cdb098ba0714","observation_id":"aac59ffe-8c51-4dbe-b93e-5e02469ed539","resolution":{"observed_at":"2026-08-06T10:32:26.134036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:26.118998Z","title":"The ecological approach to visual percep- tion: classic edition","venue":null,"work_id":"6221f362-4eaa-4cd1-8309-05cbf74fa0dc","year":2014},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.035754Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:1f700efe509c0ddc3b08ed4b27906844dadebd0f14c510a5922979798d975786","observation_id":"b87b34b5-650e-44d3-84fb-d411ecd1ce3e","resolution":{"observed_at":"2026-08-06T10:32:26.122442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.039441Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.039441Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:04470892a56fbe6e946d6de0d245c4b5d3c93552e63b4b14e969440d09a906bd","observation_id":"1d7241cb-b9aa-4747-b7cb-a1aacc2d60eb","resolution":{"observed_at":"2026-08-06T10:32:25.039441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:26.100427Z","title":"HAN- DAL: A dataset of real-world manipulable object categories with pose annotations, affordances, and reconstructions","venue":null,"work_id":"f4e93a65-55e1-4194-b22b-c53b16713192","year":2023},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.043167Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:b6b307b00dee36fdff8f630a60f7092724ed2aa0f18fc2d61d9e258f1fec8b8a","observation_id":"51891693-5bda-4954-bcce-31ebe8202c7e","resolution":{"observed_at":"2026-08-06T10:32:26.105164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08248","last_updated":"2024-03-13T05:03:58Z","snapshot_observed_at":"2026-08-16T14:10:20.449738Z","submitted_at":"2024-03-13T05:03:58Z","title":"CoPa: General Robotic Manipulation through Spatial Constraints of Parts with Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08248","snapshot_observed_at":"2026-08-06T10:32:25.047315Z","title":"Copa: General robotic manipulation through spatial constraints of parts with foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.047315Z"},"links":{"cited_paper":"/paper/2403.08248","citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:106d58596fea63f44da1fc6f99e5d4decbedeccc46097ffd430c9f8707c77763","observation_id":"45d50d61-3d24-4638-9b05-db7e36b8d77a","resolution":{"observed_at":"2026-08-06T10:32:25.047315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:26.088412Z","title":"Manipvqa: Injecting robotic affordance and physi- cally grounded information into multi-modal large language models","venue":null,"work_id":"9d6b86ff-bef3-48ae-98a7-8e4370d02526","year":2024},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.051330Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:81458fb9468611de86c90cc237899b41012929c9812f8e1ed180580fcaf84f05","observation_id":"4af09ab1-1fb9-4458-9ea9-0377dd732ca7","resolution":{"observed_at":"2026-08-06T10:32:26.092413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05973","last_updated":"2023-11-02T06:53:37Z","snapshot_observed_at":"2026-08-05T01:03:23.456778Z","submitted_at":"2023-07-12T07:40:48Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05973","snapshot_observed_at":"2026-08-06T10:32:25.055218Z","title":"V oxposer: Composable 3d value maps for robotic manipulation with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.055218Z"},"links":{"cited_paper":"/paper/2307.05973","citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:3d40338a32ccfddbb1693ea18e6f1932b622ab402ba5b1fa5401b79c4553bcf9","observation_id":"d6ccc560-4906-4dbd-8ab5-a2aa4e7525e8","resolution":{"observed_at":"2026-08-06T10:32:25.055218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01652","last_updated":"2024-11-12T04:33:26Z","snapshot_observed_at":"2026-07-29T23:37:00.228879Z","submitted_at":"2024-09-03T06:45:22Z","title":"ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01652","snapshot_observed_at":"2026-08-06T10:32:25.059061Z","title":"Rekep: Spatio-temporal reasoning of rela- tional keypoint constraints for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.059061Z"},"links":{"cited_paper":"/paper/2409.01652","citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:c5ea5c90a267c5e99497c48fc53ee6736b55b4183071d378f9a4a395b70e2187","observation_id":"2f7e2719-cc25-4c0a-8b16-d3cf56fb6074","resolution":{"observed_at":"2026-08-06T10:32:25.059061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:26.077727Z","title":"Rlbench: The robot learning benchmark & learning environment","venue":null,"work_id":"bb665949-085b-44bc-bcbe-a20e6a5ca7d1","year":2020},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.063250Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:e6ca5b2f22c355d05a0068a9277d6ada5bfd8763ab0e284664ec1ffac8395c54","observation_id":"8b1d949f-8485-4f81-a073-d20afbfb7f4e","resolution":{"observed_at":"2026-08-06T10:32:26.081647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:26.067228Z","title":"Affordpose: A large-scale dataset of hand-object inter- actions with affordance-driven hand pose","venue":null,"work_id":"32882083-a3f3-49e8-813a-d0ca6b29790d","year":2023},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.066831Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:e0ef1d01e2186ddd78c334f1bad26cac90edbe8155e917495253a8ea5635c57a","observation_id":"3a14c29d-4e7b-4c70-993c-63b4b4b12836","resolution":{"observed_at":"2026-08-06T10:32:26.070722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:26.055818Z","title":"Robo-abc: Affordance gener- alization beyond categories via semantic correspondence for robot manipulation","venue":null,"work_id":"fe8a0a0c-137f-44fc-b234-32264bde7ca0","year":2024},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.070526Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:ca770487f180d955ed2607ba4b7ec24d7588a2d27ccdd0ebcfea36ce5307c38f","observation_id":"1253d0a1-8580-42d6-9e89-9af3567d52e9","resolution":{"observed_at":"2026-08-06T10:32:26.059227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:26.045266Z","title":"Hotr: End-to-end human-object in- teraction detection with transformers","venue":null,"work_id":"03c30e62-e39f-4c86-832a-4153487b707f","year":2021},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.074259Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:11dedd6dc0c683050b882964b4f9edb2e8368fdce9437a9a55e36d8563abe55e","observation_id":"1588e184-39ef-4389-ac41-c46cd934ad2a","resolution":{"observed_at":"2026-08-06T10:32:26.049176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.077897Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.077897Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:b757c1a43d8242a25fb0fb15f6e85f5ee5c26106076e5116ef8498fea571c885","observation_id":"24b0e37e-5ef0-4fce-99b6-d89630266b2e","resolution":{"observed_at":"2026-08-06T10:32:25.077897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:26.029120Z","title":"Vi- sual object-action recognition: Inferring object affordances from human demonstration","venue":null,"work_id":"6bb74154-2d6b-478e-bd61-7e61f9988e46","year":2011},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.081468Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:2d45e4b7f4d3333b6135587f858849958db71f4d23bcdbf9ea7a05acc5289b64","observation_id":"aebd61c6-f6b9-4881-b66f-62753f1aeaff","resolution":{"observed_at":"2026-08-06T10:32:26.032562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:26.018464Z","title":"Lisa: Reasoning segmenta- tion via large language model","venue":null,"work_id":"3ce98a29-fdbb-425f-b1e6-a1b73dbe3680","year":2024},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.085945Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:de6470a879c8ea22403cacd171964cd9ddce0d945bfb04b5ef99249b08b0c61e","observation_id":"23f00b6e-7c49-48e5-84e9-10594eda234a","resolution":{"observed_at":"2026-08-06T10:32:26.022085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:26.008275Z","title":"Locate: Localize and transfer object parts for weakly super- vised affordance grounding","venue":null,"work_id":"784d609b-79e9-4d93-83e6-9e63f18b100b","year":2023},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.089454Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:ce3b6a4e1a0a25e990088660e3e4c63a07ed4fa03132ad66475ede62fde7d55f","observation_id":"144793f5-cdf2-4fa2-862d-df829fef8975","resolution":{"observed_at":"2026-08-06T10:32:26.012107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.998100Z","title":"One-shot open affordance learning with foundation models","venue":null,"work_id":"09dbc360-41c1-42d4-aefd-df05039af3cd","year":2024},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.093277Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:cbd936187558bc28bb9e0a3e5da2ddd109852ad450eb3ed07e2bebe59d12be4b","observation_id":"2aa01f02-946a-4388-905d-952bbc413809","resolution":{"observed_at":"2026-08-06T10:32:26.001822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.097176Z","title":"Learning precise affordances from egocentric videos for robotic manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.097176Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:e95b0bec25d3ce83260a61a76f8977888218d158a6e04069fe6473503bfa61b4","observation_id":"09d4aba9-02c8-4492-8209-a85854879003","resolution":{"observed_at":"2026-08-06T10:32:25.097176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.101114Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.101114Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:8dd267bef24a5a37908cf5ba331dd7ffbeb4222c441dc1141d375361e10f9619","observation_id":"bec58670-f871-4476-8703-3b5a6113d74d","resolution":{"observed_at":"2026-08-06T10:32:25.101114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.981708Z","title":"Manipllm: Embodied multimodal large language model for object-centric robotic manipulation","venue":null,"work_id":"4aba912a-1f7d-4f89-9b81-79f4d695c001","year":null},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.105353Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:8d419caf48ab96974fe7aae851d07a3dcdcdeec7ebd511f562954b40179c47fa","observation_id":"7ca354fd-8c01-4c93-9a21-92c49b5b7cda","resolution":{"observed_at":"2026-08-06T10:32:25.985386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.970526Z","title":"Laso: Language-guided affordance seg- mentation on 3d object","venue":null,"work_id":"a015952b-bbda-41f4-9206-d02da4bcbd21","year":2024},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.108987Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:2af063c0441912376f77033768b153818444e67c18401cca06356ee814a57af2","observation_id":"6133e498-05ae-4c96-b1d6-429adfa140ec","resolution":{"observed_at":"2026-08-06T10:32:25.974938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.960404Z","title":"Visual instruction tuning","venue":null,"work_id":"8d7541cf-3382-447a-a106-e739cffffed9","year":2024},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.112434Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:25eb88535c7568b83fbaccb7eb9daee8e658008cc4c56fbb78d34e64a78ed9dd","observation_id":"4df390e5-78e8-485f-bd93-ddf41488db7c","resolution":{"observed_at":"2026-08-06T10:32:25.964107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-06T10:32:25.115820Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.115820Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:7e0aa32c1c058e5029b3fc185d63245e26dc2fa1209481ebafc904e437cbdaa9","observation_id":"19797398-38b1-4ae3-aa04-539d6da20382","resolution":{"observed_at":"2026-08-06T10:32:25.115820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.950725Z","title":"Learning to seg- ment affordances","venue":null,"work_id":"dbea6a8d-ac62-4cb9-b693-5706e34f0001","year":2017},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.119669Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:72aedf45c839d468daf00da3eebd452d5482abefd00a7cbe618bc7098355c36e","observation_id":"2ee7e54e-15cd-46a6-bd93-3cf5669690cb","resolution":{"observed_at":"2026-08-06T10:32:25.954245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.940752Z","title":"Learning affordance grounding from exocen- tric images","venue":null,"work_id":"a607b250-b063-4d21-9b34-8cf5789e66a0","year":2022},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.123367Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:07f48fe623cc62f108d4739d82e58d40880a3c28e4de9f86145e58c998be00b5","observation_id":"a7ac2acf-266d-4169-b105-1550ed1a4235","resolution":{"observed_at":"2026-08-06T10:32:25.944380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.929946Z","title":"Leverage interactive affinity for affordance learning","venue":null,"work_id":"9a8add1e-ff79-4f33-88da-4ad90597f95e","year":2023},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.126799Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:f2479bbb933eb0023c24075aa0c3f5ca0273c604e73d1f55a2dd63c3ac94d8b5","observation_id":"a5ceb89e-aead-4875-957a-a69e42158963","resolution":{"observed_at":"2026-08-06T10:32:25.933636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.920489Z","title":"Affordance detection of tool parts from geomet- ric features","venue":null,"work_id":"e48b8e84-ace8-4e25-ac80-520afbcb2d5b","year":2015},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.130210Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:0fa9fc96ecc89c3ed1ddc1c772fad55c04ba063bd172c38811292d2dd1d0c5b4","observation_id":"438f2bb6-153c-4a54-8792-57f71238ec99","resolution":{"observed_at":"2026-08-06T10:32:25.923936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07872","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-16T14:19:14.631075Z","submitted_at":"2024-02-12T18:33:47Z","title":"PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07872","snapshot_observed_at":"2026-08-06T10:32:25.133699Z","title":"Pivot: Iterative visual prompt- ing elicits actionable knowledge for vlms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.133699Z"},"links":{"cited_paper":"/paper/2402.07872","citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:1833e8864f5265cab07615de22967220576d46b8ac9e74c8ac9433e58df19600","observation_id":"63494fdd-680f-4243-a7d3-231435e93d5c","resolution":{"observed_at":"2026-08-06T10:32:25.133699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.909445Z","title":"Object-based affordances detection with convolutional neural networks and dense conditional random fields","venue":null,"work_id":"785cd523-595f-4b5f-839c-032921558eb2","year":2017},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.137455Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:64d7ff4d15db1c8e7e3098609ca51ae6b2c1d9ce55b0e14c2695b40fbd0b00cd","observation_id":"279df1e3-c08e-44ad-bbb4-b792577dbaa6","resolution":{"observed_at":"2026-08-06T10:32:25.913098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11815","last_updated":"2024-06-17T17:55:29Z","snapshot_observed_at":"2026-08-16T13:42:08.042355Z","submitted_at":"2024-06-17T17:55:29Z","title":"LLARVA: Vision-Action Instruction Tuning Enhances Robot Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11815","snapshot_observed_at":"2026-08-06T10:32:25.140850Z","title":"Llarva: Vision-action instruction tuning enhances robot learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.140850Z"},"links":{"cited_paper":"/paper/2406.11815","citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:069c1b180eb501f28b1271c1de3e8e346cb9597634a573595b27b932d85cb7d4","observation_id":"fe60effd-845e-43db-8772-d8a66a868c31","resolution":{"observed_at":"2026-08-06T10:32:25.140850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-13T13:59:48.091257Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-06T10:32:25.144626Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.144626Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:e694e0845b1bc14da75075a7c99bec5c4853a22ef282e3cb4cf96e2e00b9ca12","observation_id":"568dbc66-6958-43a2-8310-8d5b8bb39810","resolution":{"observed_at":"2026-08-06T10:32:25.144626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.899643Z","title":"Understanding 3d object interaction from a single image","venue":null,"work_id":"a45a1bd8-dc3e-426f-b4a3-64ea684c5610","year":2023},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.148431Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:9de7279458b4f9aac66202f13a778d047532b12ea52625bf76a8e7072ed74f8d","observation_id":"9395c8a7-eba0-46aa-8f62-39ffcdcc682d","resolution":{"observed_at":"2026-08-06T10:32:25.903015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.890082Z","title":"Understanding 3d object articulation in in- ternet videos","venue":null,"work_id":"3f174a01-cb1d-4662-b084-c10cbfdc3778","year":2022},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.152127Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:c00d2705d0f0c3ce7903359455fdb4587578cc62c6519c5ada78da1374e0cfa6","observation_id":"4e37ce8d-e4e4-43ff-a16a-000c9eabf540","resolution":{"observed_at":"2026-08-06T10:32:25.893593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.880559Z","title":"Affordancellm: Grounding affordance from vision language models","venue":null,"work_id":"1a85cf28-f82b-43b3-8687-63ebf013a819","year":2024},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.155656Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:b46e84e65bee814d65677be4d12ce27e9b19739ffc0b6e4b928773553bf68973","observation_id":"3acbcdc1-cde4-4f33-a530-eae700447603","resolution":{"observed_at":"2026-08-06T10:32:25.884120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.870446Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"5383e24f-fdf1-4eb0-9d98-bb141dd2f210","year":2021},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.159418Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:4e7dbb02ab09ee8f469f4ccf60463ba32ba2e9309c9df6b5b478773471d9c867","observation_id":"07afc8be-be07-43f7-8b6f-c873077d85a9","resolution":{"observed_at":"2026-08-06T10:32:25.873987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.859732Z","title":"Paco: Parts and attributes of common objects","venue":null,"work_id":"775e85bf-3090-4c74-87c4-1db764cd2e97","year":2023},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.162711Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:a7203344b051cce661025526015579a9d8a7b5e9a9a3af901d46b8d37d7fd800","observation_id":"e0bda9f1-999f-44c5-b844-0d1e09efd187","resolution":{"observed_at":"2026-08-06T10:32:25.863589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.848134Z","title":"Glamm: Pixel grounding large multimodal model","venue":null,"work_id":"140b4d69-d6bf-4930-9b94-6b1223c6971a","year":null},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.166166Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:48918727d3443323e608526b43f45f11a963efb67f5ee559e2575de5c5b4625c","observation_id":"7bbee5cf-1750-4dba-9586-c234fd8b1aa5","resolution":{"observed_at":"2026-08-06T10:32:25.852279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.836128Z","title":"Language embedded radiance fields for zero-shot task- oriented grasping","venue":null,"work_id":"7ccc60fa-0a93-401d-9d3a-0482f404c2a0","year":2023},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.170505Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:ee2dd188b720d8f4aea16414ddd2a7238a0b297d45faaa41e3494513cd548942","observation_id":"584188ec-1f8a-464e-ac32-01468952ad28","resolution":{"observed_at":"2026-08-06T10:32:25.839948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-06T10:32:25.173927Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.173927Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:996a171c5bb9f674373eee86ca6a926b831414ed5ed38746d8c04291bbe614d2","observation_id":"25e4037f-77db-4d79-824d-c37fcbfdb0c9","resolution":{"observed_at":"2026-08-06T10:32:25.173927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.825131Z","title":"Weakly supervised affordance detection","venue":null,"work_id":"0aefe5a1-89ce-472d-9d84-48ddcac1a287","year":2017},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.177788Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:db550f05ba488e3a6809335bab87eb52896afab0296f790f24435ebba7779eec","observation_id":"718e2134-abb3-4c9b-a156-ee6595465e74","resolution":{"observed_at":"2026-08-06T10:32:25.828815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.813925Z","title":"Understanding human hands in contact at internet scale","venue":null,"work_id":"39544f87-9686-46c3-b89a-fb48768a88f5","year":2020},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.181313Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:7f6a1bfc95aee3b9dac749fd158ff20efa8cdcc5f1f684fe731be4356f365ff4","observation_id":"1c771262-5fa2-4d44-a6e2-29826796ef8b","resolution":{"observed_at":"2026-08-06T10:32:25.817689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.803644Z","title":"Cliport: What and where pathways for robotic manipulation","venue":null,"work_id":"f033cf0c-26c0-47ca-af05-1e7ff52a5f2e","year":2022},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.184778Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:0a863d3330bb28fe7b0278ad2b11cb1ab3ac415b2be1c0e5e7b7c60a8f7c31af","observation_id":"a0042570-37b1-472e-a294-4bcef064b000","resolution":{"observed_at":"2026-08-06T10:32:25.807772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.793496Z","title":"Going denser with open-vocabulary part segmentation","venue":null,"work_id":"f69d90fd-08ee-44e9-a44b-14357d884296","year":2023},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.188217Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:56d7c16c161aa4037bed3b8bc285a6cdee4ab5e9b808d15cafd999f77762c73a","observation_id":"977a0ac7-ec82-4179-89d8-0477a0c27e72","resolution":{"observed_at":"2026-08-06T10:32:25.796734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09818","last_updated":"2023-09-18T14:39:26Z","snapshot_observed_at":"2026-08-16T14:59:47.377665Z","submitted_at":"2023-09-18T14:39:26Z","title":"Grasp-Anything: Large-scale Grasp Dataset from Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.09818","snapshot_observed_at":"2026-08-06T10:32:25.191481Z","title":"Grasp-anything: Large-scale grasp dataset from foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.191481Z"},"links":{"cited_paper":"/paper/2309.09818","citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:8019f59e4b80de87e384e1ca263f61584d0d16565a9a1d0b74e5bd43729ba374","observation_id":"d3e103d5-bcd7-4c99-a586-9ac318fe8d39","resolution":{"observed_at":"2026-08-06T10:32:25.191481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.782301Z","title":"Language- driven grasp detection","venue":null,"work_id":"df37d306-1eea-49a8-988e-79cf809e4699","year":2024},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.195387Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:ab99c48a4b2d1e6b2042475489f9b8a92a6cc9e9757d6122801185cb0b3f6733","observation_id":"76cc7cad-e7f0-40d9-bd88-5773ab40ca61","resolution":{"observed_at":"2026-08-06T10:32:25.786244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.771906Z","title":"Bridgedata v2: A dataset for robot learning at scale","venue":null,"work_id":"9fd5ee01-2192-4af4-9fc4-7b967ffad5d8","year":2023},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.198667Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:2085a62b85964e6d8646abed07d1157df950d02ccb82cb5cc2dac86eb3adc3d1","observation_id":"84142094-1128-4c11-8447-a3a775c5d7da","resolution":{"observed_at":"2026-08-06T10:32:25.775564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.758219Z","title":"An interactive navigation method with effect-oriented affordance","venue":null,"work_id":"2dd5f606-c8a1-42ed-ae01-cbccf669ce3f","year":2024},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.202094Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:93c12202c42bf6ed5094db7664dcd81478522743d6303e51d677968029cdf3f4","observation_id":"cb04d872-397e-4752-8ce4-ab11148848da","resolution":{"observed_at":"2026-08-06T10:32:25.764209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.745418Z","title":"Move as you say interact as you can: Language-guided human motion generation with scene af- fordance","venue":null,"work_id":"458d36aa-06b3-4662-a70f-c1642c5d6f7d","year":2024},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.205440Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:3a3a95df1340190fe2d66dca492b3efc3ab40dfcc1eb356b1bfcdc6ed7fb7567","observation_id":"430feffa-065c-4c9b-8f0e-fc368e294184","resolution":{"observed_at":"2026-08-06T10:32:25.749663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.731852Z","title":"Florence-2: Advancing a unified representation for a variety of vision tasks","venue":null,"work_id":"3e15deec-3a03-4c37-a303-077c204217ed","year":2024},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.209038Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:0f82830d85cf70e7cffab71ff3c1f86c45d7247839d09221a2a7dc1e2fbf9ff7","observation_id":"6ded240c-6307-461b-911b-379849cab36e","resolution":{"observed_at":"2026-08-06T10:32:25.737293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08355","last_updated":"2024-03-13T09:12:16Z","snapshot_observed_at":"2026-08-16T14:10:16.749612Z","submitted_at":"2024-03-13T09:12:16Z","title":"NaturalVLM: Leveraging Fine-grained Natural Language for Affordance-Guided Visual Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08355","snapshot_observed_at":"2026-08-06T10:32:25.213163Z","title":"Naturalvlm: Leveraging fine-grained natural language for affordance-guided visual manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.213163Z"},"links":{"cited_paper":"/paper/2403.08355","citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:6919cf549bd422c0f0924a2a8ff95488d63317cbb1a9f54401ca981f3619ae71","observation_id":"48e361dc-13ac-4eb4-9af4-1dde956d0a3e","resolution":{"observed_at":"2026-08-06T10:32:25.213163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.717798Z","title":"Grounding 3d object affordance from 2d interactions in images","venue":null,"work_id":"9f086d57-83ba-45b9-832a-ccf348a36527","year":2023},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.218029Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:cbd1157edbf73d100ddbfbb36ff4164772ef131f252e7b1b68c3e80fc63b321c","observation_id":"6fd9515a-789e-4f06-91a7-b9eac5633680","resolution":{"observed_at":"2026-08-06T10:32:25.722125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.705365Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":"6f954a04-0ac0-433d-b5dc-bb038324d6e8","year":2016},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.221308Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:0418e6aacb383ef443a6c27a4acc3d4746e97f91fb27cc1b0e7937949ca67cb9","observation_id":"fd875b95-6f7f-4c19-8b97-e59157976fe8","resolution":{"observed_at":"2026-08-06T10:32:25.709820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20551","last_updated":"2025-02-07T05:25:16Z","snapshot_observed_at":"2026-08-16T13:14:01.471695Z","submitted_at":"2024-09-30T17:52:05Z","title":"UniAff: A Unified Representation of Affordances for Tool Usage and Articulation with Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20551","snapshot_observed_at":"2026-08-06T10:32:25.224591Z","title":"Uniaff: A unified representation of affor- dances for tool usage and articulation with vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.224591Z"},"links":{"cited_paper":"/paper/2409.20551","citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:b8a836122707b25c28aad94f5e1f0fa0de5d9a14a2a64d39ebfcef1a3005337c","observation_id":"b43e9e2e-8617-4ae6-b1c1-9fa09be7c6ca","resolution":{"observed_at":"2026-08-06T10:32:25.224591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.692509Z","title":"Taskonomy: Disentangling task transfer learning","venue":null,"work_id":"979f26de-bb0d-4aa2-bcdd-08fc89fced5b","year":2018},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.228397Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:472a3c013c393708b6360529c1a4d528e153257196f462c25b4c5235994da3c4","observation_id":"cd42b3fd-f426-48a5-8c7c-fe4fad2b5cc2","resolution":{"observed_at":"2026-08-06T10:32:25.696790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.679543Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":"f9b4dc1d-5245-4082-beed-e9540624f57b","year":2023},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.231747Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:b14b108f91b544d4eb73233dbb4e9a98e41a1ebf511ed3e3bb2081d5dc6f9909","observation_id":"efa61ad4-1320-4d33-a425-b8b343d0dc64","resolution":{"observed_at":"2026-08-06T10:32:25.684104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.666345Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":"11514c07-5976-4518-8b38-830013c342d9","year":2017},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.235310Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:c68e0c2a639da7b704461bb68182408e0b56837750b84da4925bd18e378964be","observation_id":"908f6593-54d2-4814-b086-31e55539e572","resolution":{"observed_at":"2026-08-06T10:32:25.671655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.652683Z","title":"Egoobjects: A large-scale egocentric dataset for fine-grained object understanding","venue":null,"work_id":"5dae81cc-6caa-488b-b7bf-c49d512b0e3b","year":2023},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.239020Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:fa7cafc974bdc0ebbb75ae17ba5822859aa55add747b31b37de11cb1516e327a","observation_id":"da2d1f98-7288-4761-b2af-0e39b6c1512c","resolution":{"observed_at":"2026-08-06T10:32:25.658413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.639064Z","title":"From these data, we emphasize grasping-oriented objects, encompassing both those with handles and those without","venue":null,"work_id":"a100cbd2-bf41-4ecc-bdc1-7ad5e64f0fb4","year":null},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.242797Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:d01205754964034066663caf4befb1169146a70944a7040aa92a15c146b84bf6","observation_id":"649ca24c-a3bc-48e7-bda9-6e26e480a93c","resolution":{"observed_at":"2026-08-06T10:32:25.644075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.626178Z","title":null,"venue":null,"work_id":"c8140160-6636-4b83-bc51-2507deb30fcb","year":null},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.246230Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:1319a5b4ec4614aeb902b479bf3a123adf684ce7f095534787a3681f7b53666b","observation_id":"a7e76a73-f737-4c2f-b2d3-05c9915bce55","resolution":{"observed_at":"2026-08-06T10:32:25.630711Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.611820Z","title":"microwave, open the door","venue":null,"work_id":"4706f940-0125-4937-94d3-2315b21f0a0b","year":null},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.250632Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:89c30b543fae06ecd22286c6e966ae8142c3bf0265c5ea8030da3319e403719a","observation_id":"305189ae-052a-42fd-9e34-549aeea51b18","resolution":{"observed_at":"2026-08-06T10:32:25.615905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.598278Z","title":null,"venue":null,"work_id":"895b6256-ea16-4c47-b030-b38d2d82a5e5","year":null},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.254213Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:fef36a488e450bc8ee8827225bfb0626fbc2630d59232321700f5d7f88dd4862","observation_id":"08782851-4fed-45ef-a084-bde80db069e1","resolution":{"observed_at":"2026-08-06T10:32:25.602442Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.583732Z","title":null,"venue":null,"work_id":"9d018a8e-39e0-40b5-ac6d-7deb926c02a4","year":null},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.257796Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:c9ec62225cd9f557cb79d69b621a344667c42b73170703557c97c4dc79fc9e7f","observation_id":"0606ba0a-5fc7-4ce7-9d21-425cba0712f9","resolution":{"observed_at":"2026-08-06T10:32:25.588451Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.571041Z","title":"Open the top drawer","venue":null,"work_id":"c78836e1-26c2-45d9-897d-5d1140d7a3af","year":null},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.261338Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:4bc75eeb5f94df380276ddf0ebb9a57891b048e26babd31444b5d8a0023c1bf3","observation_id":"6170e9ec-c643-47b9-b4ca-a470aaff50e0","resolution":{"observed_at":"2026-08-06T10:32:25.575152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:32:25.549462Z","title":"open the top drawer,","venue":null,"work_id":"fd0cd571-0ad1-4ee6-9744-0ce0357c75fd","year":null},"citing_paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:25.265609Z"},"links":{"citing_paper":"/paper/2507.23734"},"observation_digest":"sha256:5e90ba9ee414ede01599f4a95d80c78ef3932577f25020592983c39c3e00e26f","observation_id":"ed650da2-27aa-4526-a340-876a65596280","resolution":{"observed_at":"2026-08-06T10:32:25.553855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.23734","last_updated":"2025-07-31T17:17:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T12:41:47.016316Z","submitted_at":"2025-07-31T17:17:05Z","title":"RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":55},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 0 inbound Pith citation observations for arXiv:2507.23734."}