{"as_of":"2026-08-09T11:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fdd4c7daeb254f414d3c39f5e3cf189fd8fcf5bb8769675663dd9be5e5e8c44d","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T18:01:16.779978Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05215/citation-record","integrity":"/paper/2608.05215/integrity","json":"/paper/2608.05215/citation-record.json","paper":"/paper/2608.05215"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:18.010105Z","title":"Affordance detection of tool parts from geometric features,","venue":null,"work_id":"acbb198e-1a80-4a86-8216-47f57727b208","year":2015},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.536064Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:9896da08b893e407e137010f1adb0d736f0cc0be1c83d97d7f66874e45f2a2cc","observation_id":"4afcadd5-0916-4933-95db-b78d56ec6edd","resolution":{"observed_at":"2026-08-08T18:01:18.013283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:18.000886Z","title":"Learning affordance grounding from exocentric im- ages,","venue":null,"work_id":"f0fde847-4cb4-4a69-ad09-00df64858cfa","year":2022},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.539998Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:7b9fbe74da4656e3f1a59d7d7f8a8df6ba062e85e386fd7b9a6da0341c3ddc53","observation_id":"737c059f-3284-4117-bad3-93d266628e98","resolution":{"observed_at":"2026-08-08T18:01:18.003826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.971777Z","title":"Object-based affordances detection with convo- lutional neural networks and dense conditional random fields,","venue":null,"work_id":"359f2fa0-0bfd-40c7-9d27-f1d471cb0f7a","year":2017},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.543404Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:d210f331266a8ba6656b2e37a944ea8e69f0d20bbc7e513dc60f55aa551f8e13","observation_id":"45ecd236-96a7-471d-9a0b-a4736986750f","resolution":{"observed_at":"2026-08-08T18:01:17.981848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.939787Z","title":"Learning to act properly: Predicting and explain- ing affordances from images,","venue":null,"work_id":"f7708e34-9220-4533-a2b9-93a760114cf0","year":2018},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.546800Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:86f9d49365f59f4f5c7ab94e1b8415e29589d36a1fe1ca340467831cd2001654","observation_id":"42711c5e-a75c-4848-8349-a382a2261f98","resolution":{"observed_at":"2026-08-08T18:01:17.951637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11865","last_updated":"2025-05-17T06:14:31Z","snapshot_observed_at":"2026-08-07T15:44:25.865763Z","submitted_at":"2025-05-17T06:14:31Z","title":"GLOVER++: Unleashing the Potential of Affordance Learning from Human Behaviors for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11865","snapshot_observed_at":"2026-08-08T18:01:16.549751Z","title":"Glover++: Unleashing the potential of affordance learn- ing from human behaviors for robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.549751Z"},"links":{"cited_paper":"/paper/2505.11865","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:0ecbd5e3c0d038ff4b6becb0103bac8d1911f19668928643837dc1d407e0f412","observation_id":"a1e962bb-a85c-4fce-9409-fcff03c19749","resolution":{"observed_at":"2026-08-08T18:01:16.549751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.854206Z","title":"H2o: Two hands manipulating objects for first person interaction recognition,","venue":null,"work_id":"fb374ff7-effe-48bf-8999-d96b812ad36a","year":2021},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.553433Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:ba117326e2db30662807547d44c4061bf890eb37f00223ecb3f3b76ed53e8196","observation_id":"62e92869-c436-4582-b2e1-320c4eea03ca","resolution":{"observed_at":"2026-08-08T18:01:17.895149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.781985Z","title":"Hoi4d: A 4d egocentric dataset for category-level human-object interaction,","venue":null,"work_id":"d409e195-f69e-44b2-b230-82e3658b09e8","year":2022},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.557077Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:ee1edc698b1e24d575a3df62a9f0d23f7dd0f2e6b3ea1299521bced067064620","observation_id":"6f046d92-7583-46e3-b762-7ef55f82d38e","resolution":{"observed_at":"2026-08-08T18:01:17.811321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.763188Z","title":"Scaling egocentric vision: The epic-kitchens dataset,","venue":null,"work_id":"1ad2033b-a227-44f2-943b-543afdb4ea58","year":2018},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.560200Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:aa86927f3e452a0db14d697927af8cb74c6096dec036b8705012f4e27350c0cc","observation_id":"415a5eaf-460c-4d5f-947b-2c03f368e661","resolution":{"observed_at":"2026-08-08T18:01:17.766221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-08T23:19:12.430722Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04144","snapshot_observed_at":"2026-08-08T18:01:16.563055Z","title":"Hd-epic: A highly-detailed egocentric video dataset,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.563055Z"},"links":{"cited_paper":"/paper/2502.04144","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:d317f9789f759d8c654cf6fc8d35b6d66c98dbab0a8b60f937b78ee8578a12b3","observation_id":"25a8e8db-9fa3-4db0-8dc0-8cc1165cfd06","resolution":{"observed_at":"2026-08-08T18:01:16.563055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.754508Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video,","venue":null,"work_id":"847195eb-fb01-496d-a384-2226d0d39f95","year":2022},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.566331Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:4e39ebd5444ab3c0afc6008bcbba1063b9894a6a792dfc255bf8dddf47f95f27","observation_id":"03f5bd15-b973-486e-b67a-30ca984cf170","resolution":{"observed_at":"2026-08-08T18:01:17.757605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18259","last_updated":"2024-09-25T21:55:38Z","snapshot_observed_at":"2026-08-08T17:40:49.067743Z","submitted_at":"2023-11-30T05:21:07Z","title":"Ego-Exo4D: Understanding Skilled Human Activity from First- and Third-Person Perspectives","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18259","snapshot_observed_at":"2026-08-08T18:01:16.569282Z","title":"Ego-exo4d: Understanding skilled human ac- tivity from first- and third-person perspectives,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.569282Z"},"links":{"cited_paper":"/paper/2311.18259","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:d00509ed4fea483561741a788237363f2849329dadc233a93a9b5772ec08ead4","observation_id":"256cdff0-b054-428c-b8fe-391d72767447","resolution":{"observed_at":"2026-08-08T18:01:16.569282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-08T18:01:16.572856Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.572856Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:b712f40c4eacf09d7725010c10bc8b61d33eb5825c84a7bc82eb6cd93b90fe2b","observation_id":"6fb84ae5-9966-4d9b-9ea9-393e4f6c26d4","resolution":{"observed_at":"2026-08-08T18:01:16.572856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T18:01:16.576178Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.576178Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:888d57af3eef8ee8ca09290695b3b4a98dced06c1867c08560c6c44334cacad2","observation_id":"5c31d479-3971-455c-ac56-ae9a4f27d3b1","resolution":{"observed_at":"2026-08-08T18:01:16.576178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.736685Z","title":"Efficient training of artificial neural networks for autonomous navigation,","venue":null,"work_id":"2030f7cf-54f1-4245-9176-b629035b7a01","year":1991},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.579356Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:a4bccc9f2bb00c3264e13454370d55c21fb707dabe423e76e24dac75abf4cad9","observation_id":"1d069619-2cca-4b88-8899-aa069c6b5363","resolution":{"observed_at":"2026-08-08T18:01:17.745322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.00030","last_updated":"2023-03-07T02:29:59Z","snapshot_observed_at":"2026-08-02T00:17:16.761436Z","submitted_at":"2022-09-30T18:14:07Z","title":"VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.00030","snapshot_observed_at":"2026-08-08T18:01:16.582286Z","title":"Vip: Towards universal visual reward and representa- tion via value-implicit pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.582286Z"},"links":{"cited_paper":"/paper/2210.00030","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:cecf5737f30ee7dcab36c9933e8df4d78e72236bda0defd246980551279772e6","observation_id":"7453ea79-a5e4-4e0c-aace-a6499a1de816","resolution":{"observed_at":"2026-08-08T18:01:16.582286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06173","last_updated":"2022-03-11T18:58:10Z","snapshot_observed_at":"2026-08-06T13:06:27.360959Z","submitted_at":"2022-03-11T18:58:10Z","title":"Masked Visual Pre-training for Motor Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.06173","snapshot_observed_at":"2026-08-08T18:01:16.585792Z","title":"Masked visual pre-training for motor control,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.585792Z"},"links":{"cited_paper":"/paper/2203.06173","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:e108d058b05856fe1cbeafb73befae86ffad8e1d7eacb8dd95539c6c24cc1be9","observation_id":"199bafe5-7125-46a3-9edb-066e3711d317","resolution":{"observed_at":"2026-08-08T18:01:16.585792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12601","last_updated":"2022-11-18T05:57:09Z","snapshot_observed_at":"2026-08-02T11:48:59.131827Z","submitted_at":"2022-03-23T17:55:09Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12601","snapshot_observed_at":"2026-08-08T18:01:16.589222Z","title":"R3m: A universal visual representation for robot manipulation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.589222Z"},"links":{"cited_paper":"/paper/2203.12601","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:85193ca7d19f8056a245bb0e0f9aadd736aad5c1187d5a797af0195712e8bb05","observation_id":"f311e024-7c68-41b7-b879-9780b9ff46ba","resolution":{"observed_at":"2026-08-08T18:01:16.589222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:16.592398Z","title":null,"venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.592398Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:920368e7088684f879518954e82bb82fbbfa46b25011238748694516c7792ccb","observation_id":"ecdd8d95-bbfd-49fd-a542-c2319d15605f","resolution":{"observed_at":"2026-08-08T18:01:16.592398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.717546Z","title":"Affordances from human videos as a versatile repre- sentation for robotics,","venue":null,"work_id":"2b8c50c1-cf8f-4590-a3ae-7fd9be5384ca","year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.595173Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:b1b71d052000447d9a9421bb53032b07834266962a64fdb4fdadb743549b0599","observation_id":"7b81d6aa-d3c8-4c2f-b0e0-b2360a35ca36","resolution":{"observed_at":"2026-08-08T18:01:17.722311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-07T21:46:26.659801Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12286","snapshot_observed_at":"2026-08-08T18:01:16.598001Z","title":"Glover: Generalizable open-vocabulary affordance rea- soning for task-oriented grasping,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.598001Z"},"links":{"cited_paper":"/paper/2411.12286","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:3cf7a46001a8c15cb3b1f3ac6a9060f074be4f493123537295764de4193104fd","observation_id":"037045af-ee10-450d-ae62-be357e4848d7","resolution":{"observed_at":"2026-08-08T18:01:16.598001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.709005Z","title":"Dexycb: A benchmark for capturing hand grasping of objects,","venue":null,"work_id":"e09aad85-a3d2-4075-b0e4-a06da5c54853","year":2021},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.600947Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:abdf71f55580ee4e78e61d6aac0cbfe2d30a5061688955b21a7c34154fa18fd6","observation_id":"47592aa3-039a-4610-9769-65ec639969e8","resolution":{"observed_at":"2026-08-08T18:01:17.712184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.694020Z","title":"Videodex: Learning dexterity from internet videos,","venue":null,"work_id":"661239e2-7524-4724-8907-fdc05787056c","year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.603882Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:37350146af59b1778a0f8d7eded0b9aad65ec64042c54046fed619e7fc7454ab","observation_id":"a049b818-b85a-429c-a7a2-3a051bbb495e","resolution":{"observed_at":"2026-08-08T18:01:17.697193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18240","last_updated":"2024-02-01T19:42:05Z","snapshot_observed_at":"2026-08-09T00:13:44.553543Z","submitted_at":"2023-03-31T17:56:33Z","title":"Where are we in the search for an Artificial Visual Cortex for Embodied Intelligence?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18240","snapshot_observed_at":"2026-08-08T18:01:16.606561Z","title":"Where are we in the search for an artificial visual cortex for embodied intelligence?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.606561Z"},"links":{"cited_paper":"/paper/2303.18240","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:e14ab1993b6bb4ef2657689d09f72d109c0b0fee7dec23707754e6b7d5a220c0","observation_id":"185a3a09-3a05-491c-9e43-c17168325096","resolution":{"observed_at":"2026-08-08T18:01:16.606561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00958","last_updated":"2023-06-01T17:52:23Z","snapshot_observed_at":"2026-08-06T20:32:01.174179Z","submitted_at":"2023-06-01T17:52:23Z","title":"LIV: Language-Image Representations and Rewards for Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00958","snapshot_observed_at":"2026-08-08T18:01:16.609530Z","title":"Liv: Language-image representations and rewards for robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.609530Z"},"links":{"cited_paper":"/paper/2306.00958","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:5adaec8c24c33c36f4769b17c93c074fce310355bd5183334e4605f994367088","observation_id":"ac586404-0b6b-43e5-8dfe-a93647b520b7","resolution":{"observed_at":"2026-08-08T18:01:16.609530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.685878Z","title":"Hrp: Human affordances for robotic pre- training,","venue":null,"work_id":"324dcc05-2528-401a-adfb-1ab9f6683afe","year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.613059Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:f0a2ccc21eabc02c8df9dcbda8f5b81136fe844ae13ba7901b94c89940ff158f","observation_id":"9a3bd658-5224-4d52-b996-4ef86f051fa4","resolution":{"observed_at":"2026-08-08T18:01:17.688991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07135","last_updated":"2025-03-27T21:33:39Z","snapshot_observed_at":"2026-08-07T17:17:23.602919Z","submitted_at":"2025-03-10T10:04:58Z","title":"VidBot: Learning Generalizable 3D Actions from In-the-Wild 2D Human Videos for Zero-Shot Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07135","snapshot_observed_at":"2026-08-08T18:01:16.616474Z","title":"Vidbot: Learning generalizable 3d actions from in- the-wild 2d human videos for zero-shot robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.616474Z"},"links":{"cited_paper":"/paper/2503.07135","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:de676ff9a214ce634c65d2381f629bcb73502f21cf3786520252048d2ed75df6","observation_id":"1a14e57d-602e-4b17-9612-b82b3bf0bf1c","resolution":{"observed_at":"2026-08-08T18:01:16.616474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.673277Z","title":"Weakly supervised affordance detection,","venue":null,"work_id":"97310ffe-b830-428b-8065-cac72b552053","year":2017},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.620035Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:50186ace39291cd2adb3dc3bfcd416e4052cdbb2f5ade813b53ae63ee96d1670","observation_id":"28494b12-e07b-4b42-9380-104fbf4387bc","resolution":{"observed_at":"2026-08-08T18:01:17.680508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.584061Z","title":"Locate: Localize and transfer object parts for weakly supervised affordance grounding,","venue":null,"work_id":"baaaa8c2-b6e4-4bae-b9e8-5666b6972c3b","year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.623532Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:4a7dac19cdb6c699292432126ac67fd631c54675c565635447bbb8dc85598662","observation_id":"82283a00-7753-47a8-9c02-746ed0f2ea23","resolution":{"observed_at":"2026-08-08T18:01:17.632639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.522666Z","title":"Affordancellm: Grounding affordance from vision language models,","venue":null,"work_id":"90c0458f-5c4f-4a0a-8ec0-6d9518559bc2","year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.626443Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:53dd5eb867b70f5afcc6fed6ed05d58da10f484cd228459a59dd7350218a8d69","observation_id":"302c82a3-ba4f-432a-812d-0595356cd66e","resolution":{"observed_at":"2026-08-08T18:01:17.530197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09284","last_updated":"2025-08-25T19:45:29Z","snapshot_observed_at":"2026-08-08T15:02:00.662012Z","submitted_at":"2025-06-10T22:47:16Z","title":"UAD: Unsupervised Affordance Distillation for Generalization in Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09284","snapshot_observed_at":"2026-08-08T18:01:16.629217Z","title":"Uad: Unsupervised affordance distillation for gener- alization in robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.629217Z"},"links":{"cited_paper":"/paper/2506.09284","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:5e8f6c035334bc9a468141b50c9fe41fe2cb1460f2fb291ffcf514e6ef1a11ee","observation_id":"7d9ddb00-788c-4c53-af49-f5898a6771a5","resolution":{"observed_at":"2026-08-08T18:01:16.629217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.513800Z","title":"Arctic: A dataset for dexterous bimanual hand-object manipulation,","venue":null,"work_id":"26720561-6183-420d-b71a-07b42c0a2d5f","year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.632022Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:1a2ceb03c27cfc970590fc15a22a81df01ba2af955e7fe8677018a1b0258a05e","observation_id":"f2e4e690-726b-4e55-8dee-6bb6b08e5796","resolution":{"observed_at":"2026-08-08T18:01:17.517069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.505598Z","title":"Contactpose: A dataset of grasps with object contact and hand pose,","venue":null,"work_id":"4b0a4605-8280-42e9-a150-382411469d08","year":2020},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.635490Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:154925737f8e6f1cc47b7ce735555700ae7a09c9179229206a01226246f0e618","observation_id":"2d0a5f96-7ad8-4499-bec2-947c838f8307","resolution":{"observed_at":"2026-08-08T18:01:17.508549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.497867Z","title":"Oakink: A large-scale knowledge repository for understanding hand-object interaction,","venue":null,"work_id":"74006b1e-f72e-48a8-95ba-556aac2bb292","year":2022},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.638183Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:3ac36fec4e17ab9ada76ac5cb56773c0f5378b5faa6bda03ec698a500e117333","observation_id":"77ba9438-3b92-4fc7-bc55-fdad3caf5c21","resolution":{"observed_at":"2026-08-08T18:01:17.500390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08399","last_updated":"2024-03-25T16:50:43Z","snapshot_observed_at":"2026-08-07T17:52:08.685927Z","submitted_at":"2024-01-16T14:41:42Z","title":"TACO: Benchmarking Generalizable Bimanual Tool-ACtion-Object Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08399","snapshot_observed_at":"2026-08-08T18:01:16.641293Z","title":"Taco: Benchmarking generalizable bimanual tool-action- object understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.641293Z"},"links":{"cited_paper":"/paper/2401.08399","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:3478e0fd4bf2af7b2022e1e4a00572cc0924df94f62a500bf85fdb78ea999dcb","observation_id":"ae0e54f0-4f30-4e0f-bb85-d5738497ec7a","resolution":{"observed_at":"2026-08-08T18:01:16.641293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-08T18:01:16.644533Z","title":"Rt-1: Robotics transformer for real-world control at scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.644533Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:39e32ba96d1434aab527359d1a6ce432b0346ea8554199df7bd038f030ff012c","observation_id":"a7fa2ba1-2ad6-4042-a8a6-b099d5b6de3b","resolution":{"observed_at":"2026-08-08T18:01:16.644533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-08T18:01:16.647941Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.647941Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:55f6f570eb0e612fa8c900328c09dee5170fb0db006eb90f611d799d95c5d7f9","observation_id":"f0834910-a2e2-44ea-b176-3987593bb2f3","resolution":{"observed_at":"2026-08-08T18:01:16.647941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-08T18:01:16.650865Z","title":"Openvla: An open-source vision-language-action model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.650865Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:814fa175f563408ca50f1244f61b9f83ba5625a9b24b96d03e7419a70439b9f2","observation_id":"860b4e08-c7b5-4619-9d48-352a770d01a5","resolution":{"observed_at":"2026-08-08T18:01:16.650865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-08T18:01:16.654079Z","title":"Octo: An open-source generalist robot policy,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.654079Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:a8507f1f0e53df6e1055519f3f65f4a2cfd49e6665a1f2d730d685611e371c59","observation_id":"73ee612d-2cd4-45f6-bc31-a5f081d21bec","resolution":{"observed_at":"2026-08-08T18:01:16.654079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-08T01:53:43.555672Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-08T18:01:16.657265Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.657265Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:19c764365de9788ab93374068b36a33fadf9f21db8bfdd3669053ca24780a53a","observation_id":"740781d5-193d-4326-9eb2-ceca4192ae9f","resolution":{"observed_at":"2026-08-08T18:01:16.657265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.489722Z","title":"Droid: A large-scale in-the-wild robot manipu- lation dataset,","venue":null,"work_id":"5b49d6eb-cb7d-4f8d-a165-b76559f11d3a","year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.660510Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:fb8f1dc9fb0b1c1053673f7eb2342bc36a95706d0f064dc0b7fdc8df75b8b13b","observation_id":"4a6f6391-124f-473e-bc9c-ac5037d9c8fd","resolution":{"observed_at":"2026-08-08T18:01:17.492748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.482397Z","title":"Embodied hands: Modeling and capturing hands and bodies together,","venue":null,"work_id":"dbc0f367-1d51-4b25-860d-b8df6194746b","year":2017},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.663405Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:54185a29bc3d1a8a2fcf9e89eabed6dc93bc05107e331c45c7cd7b7f60a8886d","observation_id":"58cc99cf-5216-4b4e-9ed6-eb0907e52b96","resolution":{"observed_at":"2026-08-08T18:01:17.484941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.474463Z","title":"On the continuity of rotation representations in neural networks,","venue":null,"work_id":"6c22b179-9d78-4163-a515-ec0acc6fcca2","year":2019},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.666562Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:84b25afb3bdff5b3bf7b3a2f4e869c5d33479a97f2da5614e65b6f686fec11f8","observation_id":"f73652f3-7549-4cf5-b5f7-eb0aab744698","resolution":{"observed_at":"2026-08-08T18:01:17.477628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.465879Z","title":"Understanding human hands in contact at internet scale,","venue":null,"work_id":"2a54e71e-5152-4fb7-af4a-0e94a7eec143","year":2020},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.669770Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:4b4b91b4c99d84df50e817298ab88b7604012437dcf1748d6dd6614518405f43","observation_id":"adc1acb2-2eac-4a54-aaae-e125d852bd85","resolution":{"observed_at":"2026-08-08T18:01:17.469017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-08T18:01:16.672794Z","title":"Sam 2: Segment anything in images and videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.672794Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:f7d5191f05d154018fb6cca1ee28f98372fab31ccabd3088dde880b9457b550d","observation_id":"a13e96ae-e07b-4b61-b85f-7cf605259994","resolution":{"observed_at":"2026-08-08T18:01:16.672794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.457443Z","title":"Vitpose: Simple vision transformer baselines for human pose estimation,","venue":null,"work_id":"9c2a6f5e-ebeb-49d3-855e-2da94d381bdd","year":2022},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.677011Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:5f1e4a97c05937297934a612a2536fba11e076209dc727af0a70121f2576b6d8","observation_id":"337de9e0-c609-4eae-a8f2-0ee84ca9dd0f","resolution":{"observed_at":"2026-08-08T18:01:17.460517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11831","last_updated":"2024-10-15T17:56:32Z","snapshot_observed_at":"2026-08-03T21:35:04.144048Z","submitted_at":"2024-10-15T17:56:32Z","title":"CoTracker3: Simpler and Better Point Tracking by Pseudo-Labelling Real Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11831","snapshot_observed_at":"2026-08-08T18:01:16.679697Z","title":"Cotracker3: Simpler and better point tracking by pseudo-labelling real videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.679697Z"},"links":{"cited_paper":"/paper/2410.11831","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:f63bb3c53bffe17c4d9d900bab5547a8d90221a5dc2a304911c46d462eb921e2","observation_id":"2d4fac88-8ece-43a2-b2b5-32513591a9f8","resolution":{"observed_at":"2026-08-08T18:01:16.679697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10034","last_updated":"2024-07-14T00:53:14Z","snapshot_observed_at":"2026-07-06T18:45:56.344947Z","submitted_at":"2024-07-14T00:53:14Z","title":"Partial Implementation of Max Flow and Min Cost Flow in Almost-Linear Time","version":1},"cited_work":{"arxiv_id":"2407.10034","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.10034","snapshot_observed_at":"2026-08-08T18:01:16.979801Z","title":"Partial Implementation of Max Flow and Min Cost Flow in Almost-Linear Time","venue":"cs.DS","work_id":"2423c2f1-5b65-4132-9843-9b51df7a0ce8","year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.683535Z"},"links":{"cited_paper":"/paper/2407.10034","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:a8c9000849d45539c9937ead70650c8f21af802cf20a8650e30705b630f8642c","observation_id":"e644f7fe-012b-4b8d-838f-6ced7cd0d4b5","resolution":{"observed_at":"2026-08-08T18:01:16.982789Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.449084Z","title":"Egohos: Dataset and method for hand and object segmentation in egocentric videos,","venue":null,"work_id":"d3b0616c-c97c-47ba-9f0b-21fff05a0fda","year":2022},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.690128Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:5ff5d71be970ed1f8b6187a98c0b5a94156a8aa487ac8adf273d2ad2168e6f50","observation_id":"ddd8f7f0-4eae-4885-b123-7ec83f4881a5","resolution":{"observed_at":"2026-08-08T18:01:17.452196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03897","last_updated":"2023-09-07T17:57:29Z","snapshot_observed_at":"2026-07-06T16:15:50.904062Z","submitted_at":"2023-09-07T17:57:29Z","title":"ProPainter: Improving Propagation and Transformer for Video Inpainting","version":1},"cited_work":{"arxiv_id":"2309.03897","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.03897","snapshot_observed_at":"2026-08-08T18:01:16.968600Z","title":"ProPainter: Improving Propagation and Transformer for Video Inpainting","venue":"cs.CV","work_id":"ce7c5bdf-ad48-4424-bac6-b96380822ee8","year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.693925Z"},"links":{"cited_paper":"/paper/2309.03897","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:9c854d2ae459fe05ca7697171f9d6f94f85c94604e2d681d2c6d94d8c32156ad","observation_id":"cb7605e1-a217-4fb8-9ca8-f5a21f108487","resolution":{"observed_at":"2026-08-08T18:01:16.971566Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02546","last_updated":"2025-07-03T11:40:01Z","snapshot_observed_at":"2026-07-06T21:51:38.554688Z","submitted_at":"2025-07-03T11:40:01Z","title":"MoGe-2: Accurate Monocular Geometry with Metric Scale and Sharp Details","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02546","snapshot_observed_at":"2026-08-08T18:01:16.698219Z","title":"Moge-2: Accurate monocular geometry with metric scale and sharp details,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.698219Z"},"links":{"cited_paper":"/paper/2507.02546","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:b72bd46b3448458ae8fa57fd5de753c10e6b9e1bf260ab8f173e8b9c85b397e3","observation_id":"eecb27d4-4607-4903-aad2-264f6ab5d6c0","resolution":{"observed_at":"2026-08-08T18:01:16.698219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.429597Z","title":"Structure-from-motion revisited,","venue":null,"work_id":"457cc632-c0ea-4a59-9e21-bd0f71517319","year":2016},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.701629Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:9ddd3ec0c85704898507b720050433482711726e7bcd369b7a2f87a1bf03fa22","observation_id":"2799165f-53ac-4ec4-8364-369b457b7872","resolution":{"observed_at":"2026-08-08T18:01:17.443547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.386845Z","title":"Droid-slam: Deep visual slam for monocular, stereo, and rgb-d cameras,","venue":null,"work_id":"a166e2bf-588e-4df0-ae33-f80084aed5ec","year":2021},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.704962Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:ccc9b02bc0e0988616d5f7c0bc6e4f81cb6764dc23ca9b3192b1f3f85d821e2c","observation_id":"b735d328-27e1-415b-974e-7dfae58a4a13","resolution":{"observed_at":"2026-08-08T18:01:17.404213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03904","last_updated":"2024-03-25T18:02:25Z","snapshot_observed_at":"2026-07-06T16:58:03.812619Z","submitted_at":"2023-12-06T20:57:08Z","title":"Cosmological parameters estimated from velocity -- density comparisons: Calibrating 2M++","version":2},"cited_work":{"arxiv_id":"2312.03904","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.03904","snapshot_observed_at":"2026-08-08T18:01:16.943551Z","title":"Cosmological parameters estimated from velocity -- density comparisons: Calibrating 2M++","venue":"astro-ph.CO","work_id":"06108162-888a-4115-b490-19e997e3bdde","year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.708765Z"},"links":{"cited_paper":"/paper/2312.03904","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:865bf2d3496b2949f42a2118c165b949a9f1f9861dd30cb7d4121469d776e68e","observation_id":"8759fa19-9196-41fa-aa92-4de9b38f996b","resolution":{"observed_at":"2026-08-08T18:01:16.949195Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.343200Z","title":"Lisa: Reasoning segmentation via large language model,","venue":null,"work_id":"154ff1d9-2ecd-49f8-8003-0ab1a5a63f97","year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.712491Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:f96785dc4e53fc5e904404a09a66e5cc8817f7765bc36c5a566a80cb3cddc372","observation_id":"fdc8a646-0858-4a01-9fd9-d9cbced9a379","resolution":{"observed_at":"2026-08-08T18:01:17.363917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-08T18:01:16.715426Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.715426Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:22806dd580bf782dc6eadee7856acc07c38f019b5e5407859fa32af64a6fcd0f","observation_id":"79e1bd6b-7dc9-4cd2-bf84-99dc67c80cf2","resolution":{"observed_at":"2026-08-08T18:01:16.715426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-08T18:01:16.718848Z","title":"Qwen2.5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.718848Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:f96ea2b8735506ff1c66e2e2a45427c7ac1dbdd86b869e94374858bec2b7d414","observation_id":"f23d786b-694b-4c92-a8c0-f58f8cd3218f","resolution":{"observed_at":"2026-08-08T18:01:16.718848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.305373Z","title":"Handal: A dataset of real-world manipulable object categories with pose annotations, affordances, and reconstructions,","venue":null,"work_id":"6bbff1b2-79ae-46a6-bf96-5df936456fcd","year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.722078Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:dcc1e34a824f4f0552f881fc01abd131ed2d28d7661ac0fae15cf009780bd3e1","observation_id":"cfd00c33-f0af-4c47-b0ff-dac2de245f0c","resolution":{"observed_at":"2026-08-08T18:01:17.322968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.271764Z","title":"Scenefun3d: Fine-grained functionality and affor- dance understanding in 3d scenes,","venue":null,"work_id":"d3bf0116-d59e-4c7c-89bb-a555380fa0fc","year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.724875Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:45b20542e6ed8b773813242afe173b5f45eb7300183f61654bf68310b98cbed3","observation_id":"c2c8c255-f4fe-4369-bd13-4008e10a089d","resolution":{"observed_at":"2026-08-08T18:01:17.283009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.263105Z","title":"Understanding 3d object interaction from a single image,","venue":null,"work_id":"1d21630b-6608-458e-bd5b-603f4b97e0f0","year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.728322Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:c69cb96bb2fdf22ea911bc9b564fa6bbf32788b62af3bc7f732b24655dd3018c","observation_id":"9d6cb10d-c1e1-4346-a1e3-342f08dc0d22","resolution":{"observed_at":"2026-08-08T18:01:17.266440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04689","last_updated":"2024-07-05T17:50:38Z","snapshot_observed_at":"2026-07-06T18:42:05.670928Z","submitted_at":"2024-07-05T17:50:38Z","title":"RAM: Retrieval-Based Affordance Transfer for Generalizable Zero-Shot Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04689","snapshot_observed_at":"2026-08-08T18:01:16.731423Z","title":"Ram: Retrieval-based affordance transfer for generalizable zero-shot robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.731423Z"},"links":{"cited_paper":"/paper/2407.04689","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:dbecae4ce9a031913e3a7bdf0c858e1e1b6dbf3facde7a0b685b73bf369d18dd","observation_id":"c0fc3ebb-0e0f-44b9-ab11-b8af73969e03","resolution":{"observed_at":"2026-08-08T18:01:16.731423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:16.735394Z","title":"Generalflow: Generalizable manipulation policy with flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.735394Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:5e28f0e5264e0b8e93fef424623b75e4d13432478e9f2ebc2085abd64a7dbd25","observation_id":"10f87d64-38e4-41bd-83c1-e9b623a85cea","resolution":{"observed_at":"2026-08-08T18:01:16.735394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.254413Z","title":"Graspnet-1billion: A large-scale benchmark for general object grasping,","venue":null,"work_id":"27e5f875-4583-4a7d-9528-4d6a92a103fb","year":2020},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.739749Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:cfc27f11028a69855e443de82ab594fe2ac1ab6d25e0b2382268b17c746bb64f","observation_id":"dbce1271-1683-4f1c-ae77-aded962f06e7","resolution":{"observed_at":"2026-08-08T18:01:17.257624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.245968Z","title":"R+x: Retrieval and execution from everyday human videos,","venue":null,"work_id":"cfcce9c5-15a8-40b0-b370-c413e8c3bc9e","year":2025},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.744681Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:c33c3a2c3ed120aad4f5053a80dc81a02652751a0856df1c31347856eef1ab29","observation_id":"0ce24f75-d874-4b80-8241-2dc6602ccc45","resolution":{"observed_at":"2026-08-08T18:01:17.249151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10470","last_updated":"2021-08-25T23:42:59Z","snapshot_observed_at":"2026-07-06T11:40:56.544714Z","submitted_at":"2021-08-24T01:38:11Z","title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10470","snapshot_observed_at":"2026-08-08T18:01:16.749849Z","title":"Isaac gym: High performance gpu- based physics simulation for robot learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.749849Z"},"links":{"cited_paper":"/paper/2108.10470","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:ff71d6215644565beb61aa00dd41df8a48521ba04344b0237db60a1011d04c02","observation_id":"8a16cb37-f10f-40e4-ac25-7ee8770c1759","resolution":{"observed_at":"2026-08-08T18:01:16.749849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.236230Z","title":"Partmanip: Learning cross-category generalizable part manipulation policy from point cloud observations,","venue":null,"work_id":"da736720-44f0-440f-a57f-9c4a2883de73","year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.756165Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:764e7e9ff10e94f49bdd7184ca665194e81d69420855da7bd1a6a46ac8450dc3","observation_id":"43ecab4d-afdc-401c-8985-05abc85f90dc","resolution":{"observed_at":"2026-08-08T18:01:17.239675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.226728Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning,","venue":null,"work_id":"54b255e5-3d16-41d2-bbd1-f3b676003a30","year":2019},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.762422Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:e8890dd858475df4335bfcd5b6b6bc0c49467c920886aec3f0a378b9c814c989","observation_id":"4c206d36-488b-4132-8b50-3d28cd05b34c","resolution":{"observed_at":"2026-08-08T18:01:17.230123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.217320Z","title":"Maniskill2: A unified benchmark for generalizable manipulation skills,","venue":null,"work_id":"f1f5af7f-1c49-469b-be6b-f93f8159b103","year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.769923Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:468baf8811f3cd8768f5af6047ad536f2718ca21cfb568514426772e25f1ec58","observation_id":"4f11054a-a739-4ca8-b5d3-3f2795a44ca0","resolution":{"observed_at":"2026-08-08T18:01:17.220850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.207741Z","title":"Ag2manip: Learning novel manipulation skills with agent-agnostic visual and action representations,","venue":null,"work_id":"c20ebdb1-0b53-4711-95f5-edca88b88a56","year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.773180Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:be5491c13ca414c84280e518f72f6b4b1151ed5a6dff0e2212b9c5b11707e12e","observation_id":"c3de1a73-28dc-4f25-afe4-a991ea4a3205","resolution":{"observed_at":"2026-08-08T18:01:17.211220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.197150Z","title":"Pointllm: Empowering large language models to understand point clouds,","venue":null,"work_id":"d3b95621-3ba9-45bb-86a4-787d2f9f0d61","year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.777002Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:8004a02aaf0d9ce628d0dd9638ea78e17828d05a939fdc372c66c86abc98db35","observation_id":"97febfe7-476a-474b-bd2e-eb2a8fc6ef54","resolution":{"observed_at":"2026-08-08T18:01:17.200369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.162467Z","title":"Generating 6dof object manipulation trajectories from action description in egocentric vision,","venue":null,"work_id":"f7bcfc3c-e540-4621-b02d-aa6a92c7cb18","year":2025},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.779978Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:7b23039d22d205d9e2ea736aae9d0d9f80c8cb5f1c55231540c95bb1b5e48682","observation_id":"a4e6b661-3308-4060-b8a1-0d8ecb8ecdc7","resolution":{"observed_at":"2026-08-08T18:01:17.190849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-09T11:10:54.401410Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":28,"verified_exact":2,"verified_fuzzy":39},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2608.05215."}