{"as_of":"2026-08-05T02:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ac884f7588c180e68f09ca1f5c2fd2744ca6f78cd85182629fcfd0d415647d41","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T17:08:58.001742Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.17754/citation-record","integrity":"/paper/2607.17754/integrity","json":"/paper/2607.17754/citation-record.json","paper":"/paper/2607.17754"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:54.875628Z","title":"Depth-aware cnn for rgb-d segmenta- tion,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:54.875628Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:8d9f4e2cad525d6e628a2b790449d3cd59279bb8ccfd857f98d66dc5d855b27e","observation_id":"d0ed9b17-427a-444f-9fcc-127d9311a971","resolution":{"observed_at":"2026-08-01T17:08:54.875628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:54.990657Z","title":"A brief survey on rgb- d semantic segmentation using deep learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:54.990657Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:8a52facb0c32b53fd57db21aba07d9235ba6865be37e0df9f381a25baae985c1","observation_id":"17f02d92-675c-456e-b510-7f4be8c60dfb","resolution":{"observed_at":"2026-08-01T17:08:54.990657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04159","last_updated":"2021-03-18T03:14:26Z","snapshot_observed_at":"2026-07-06T10:02:45.105181Z","submitted_at":"2020-10-08T17:59:21Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04159","snapshot_observed_at":"2026-08-01T17:08:55.107754Z","title":"Deformable detr: Deformable transformers for end-to-end object detection,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:55.107754Z"},"links":{"cited_paper":"/paper/2010.04159","citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:7766d11178259e0679cce5ae4e381231641e67ee9f8b078bd9a62bad6ee28d95","observation_id":"f6114f73-272a-4c18-8d4b-a8f757e721a5","resolution":{"observed_at":"2026-08-01T17:08:55.107754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:55.175768Z","title":"Easylabel: A semi-automatic pixel-wise object annotation tool for creating robotic rgb-d datasets,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:55.175768Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:2e5dd0d8ba8901fb7ca4b3fcdf326b5ca363e2433bdd696079196e4561849aed","observation_id":"9dc4b705-80fc-4fc6-9b0b-d4ac6b6b57d8","resolution":{"observed_at":"2026-08-01T17:08:55.175768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:55.247351Z","title":"Fpcc: Fast point cloud clustering-based instance segmentation for industrial bin-picking,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:55.247351Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:93a49bf5cc89cad5b327c934a8a437d2f008ce5ca7d6c861c2c946639a906740","observation_id":"01967b40-274f-4b47-a6ca-625025903a6d","resolution":{"observed_at":"2026-08-01T17:08:55.247351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:55.389053Z","title":"A convolutional neural net- work for point cloud instance segmentation in cluttered scene trained by synthetic data without color,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:55.389053Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:67d7b538a864962b7a680b997083bb476c1534b25893b5b467a6bacaeefe9671","observation_id":"4cd7bdb1-cbed-4a62-993b-44010e1d973b","resolution":{"observed_at":"2026-08-01T17:08:55.389053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.14663","last_updated":"2022-08-30T17:53:40Z","snapshot_observed_at":"2026-07-06T12:23:18.737651Z","submitted_at":"2021-12-29T17:23:24Z","title":"MetaGraspNet_v0: A Large-Scale Benchmark Dataset for Vision-driven Robotic Grasping via Physics-based Metaverse Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.14663","snapshot_observed_at":"2026-08-01T17:08:55.497554Z","title":"Metagraspnet v0: A large-scale benchmark dataset for vision-driven robotic grasping via physics-based metaverse synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:55.497554Z"},"links":{"cited_paper":"/paper/2112.14663","citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:e7d3a72ac6fe1082761cfe551fab6167d0f59efef505dd52cd5a588b4216bf04","observation_id":"7d7f2808-abf4-4b9f-969b-5a1d2eca4afa","resolution":{"observed_at":"2026-08-01T17:08:55.497554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:55.579594Z","title":"Metagraspnet: A large-scale benchmark dataset for scene-aware am- bidextrous bin picking via physics-based metaverse synthesis,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:55.579594Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:6886cbcddb8a45437e2b22bf8afdad9a3a8dc70c5afc96fe0fc0a62be47a5b02","observation_id":"b3506b42-0aa8-4fcc-a4f5-e81ccbd6bca8","resolution":{"observed_at":"2026-08-01T17:08:55.579594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:55.675702Z","title":"Segmentation of unknown objects in indoor environments,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:55.675702Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:c267001fc75fc1a329810b66091335811eb1b2f82c3a4ee280e287b400768a39","observation_id":"21e96199-fe6f-4e51-96dc-4f98348ded2b","resolution":{"observed_at":"2026-08-01T17:08:55.675702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:55.813759Z","title":"Dorapicker: An autonomous picking system for general objects,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:55.813759Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:d3faf41a579c38f30185bcc9be1ea1b320fd7af7006277025f9aa1a544ca80c2","observation_id":"be90323b-064d-4b23-a788-a787c4562b5d","resolution":{"observed_at":"2026-08-01T17:08:55.813759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:55.868757Z","title":"A robust robot design for item picking,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:55.868757Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:d4ea300baf66fc2ef04f294b49cef93d2d2b1916f602c453b54642b8ca1cc5a7","observation_id":"84705aba-8bf5-4051-b0ea-b5d8c6d1bb93","resolution":{"observed_at":"2026-08-01T17:08:55.868757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:55.936703Z","title":"Seg2grasp: A robust modular suction grasping in bin picking,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:55.936703Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:198b057a34f848dadf153514a4fba8b87011038dc420564e1ee162199c7ab24d","observation_id":"16ca57bb-2c6a-41d9-8230-5e7de46857d5","resolution":{"observed_at":"2026-08-01T17:08:55.936703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:56.031230Z","title":"A sim-to-real object recognition and localization framework for industrial robotic bin picking,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:56.031230Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:59d3c8acccab5381924d43cce5af131df8c01e258de9d326ff2a455d191d5152","observation_id":"eb168934-f797-4bae-97d9-b95fddab58dc","resolution":{"observed_at":"2026-08-01T17:08:56.031230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:56.114114Z","title":"Mask r-cnn,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:56.114114Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:0330dcd18dd809e85d69e5a9f3c0338d45590d52f0ebc29426d32a5c194c5ead","observation_id":"09147100-7b75-4c2c-976d-111e23ac3426","resolution":{"observed_at":"2026-08-01T17:08:56.114114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:56.211985Z","title":"The best of both modes: Separately leveraging rgb and depth for unseen object instance segmentation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:56.211985Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:6ce2691c0dcfc2261bb84218aa733f4267bc557eb5978f7e87bf79ffae95581f","observation_id":"e3f96b5d-ebe6-4695-9010-a6b23c8c294f","resolution":{"observed_at":"2026-08-01T17:08:56.211985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:56.288279Z","title":"Unseen object in- stance segmentation for robotic environments,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:56.288279Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:fbf124ea370d56c697346f3f9f1afc49a655b0e04d43acc6c7a388b732f5eefc","observation_id":"441c7a9d-9c25-453c-8354-a184566438a0","resolution":{"observed_at":"2026-08-01T17:08:56.288279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:56.424156Z","title":"Unseen object amodal instance segmentation via hierarchical occlusion mod- eling,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:56.424156Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:fb7b0bf407fa75c248ddc49dad71bf5b91aca32ba7d2f15653ab310e84d9c61b","observation_id":"126eb0f3-3fb5-4dae-a8f6-73e1558755e2","resolution":{"observed_at":"2026-08-01T17:08:56.424156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:56.542316Z","title":"Per-pixel classification is not all you need for semantic segmentation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:56.542316Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:7ab9d9925a69832c0840b164cbbf3ca813da9e5c74ac26284a8a202532c7bad8","observation_id":"84da1eca-a68f-4177-a31c-94187ce8b3db","resolution":{"observed_at":"2026-08-01T17:08:56.542316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:56.644635Z","title":"Masked-attention mask transformer for universal image segmenta- tion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:56.644635Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:1f6ffd278d1607d87aa0daf1ef37836a2748cdd631eb6421b04ab0f34ad1ec18","observation_id":"f29945d2-8984-4b06-a4a5-63b27af74bb2","resolution":{"observed_at":"2026-08-01T17:08:56.644635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:56.740829Z","title":"Learning rgb-d feature embeddings for unseen object instance segmentation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:56.740829Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:79cd3f16e4c5f6d89c55bc5c0bd252801f6b7e6161b3e0952461552519b640f4","observation_id":"c9a80c7f-0bb9-481e-97cc-66174be03666","resolution":{"observed_at":"2026-08-01T17:08:56.740829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11679","last_updated":"2023-09-21T23:04:42Z","snapshot_observed_at":"2026-07-06T14:21:18.799177Z","submitted_at":"2022-11-21T17:47:48Z","title":"Mean Shift Mask Transformer for Unseen Object Instance Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11679","snapshot_observed_at":"2026-08-01T17:08:56.864523Z","title":"Mean shift mask transformer for unseen object instance segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:56.864523Z"},"links":{"cited_paper":"/paper/2211.11679","citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:df84b1cc4910b936c5e678ac47ed2043113cf64f3186769eb3991ba16a880127","observation_id":"c82d2215-5197-4bc5-bfc8-14d6bdb67dac","resolution":{"observed_at":"2026-08-01T17:08:56.864523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:56.951985Z","title":"Fuseseg: Semantic segmentation of urban scenes based on rgb and thermal data fusion,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:56.951985Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:e3ea207dc5051a9955f00cf74bb9aaa2e0972b443c7bbdf14c68b5b254b493f5","observation_id":"747c0b4f-7819-4a25-bd59-94e44fc57228","resolution":{"observed_at":"2026-08-01T17:08:56.951985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:57.065051Z","title":"Cmx: Cross-modal fusion for rgb-x semantic segmentation with transform- ers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:57.065051Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:82dfe1dc8107da366635b95464757a4a565cc087c75d0cada3e785be3b175aa1","observation_id":"1263a35f-1017-4dfe-b463-4c2970b727ba","resolution":{"observed_at":"2026-08-01T17:08:57.065051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:57.144237Z","title":"Early or late fusion matters: Efficient rgb- d fusion in vision transformers for 3d object recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:57.144237Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:07293f400bafb52f04134fda5f4e8fdbaceabecaeb5f7c910d0cbbd5537a5c03","observation_id":"7dcc429e-7d94-4aa9-96da-1bc26160a40f","resolution":{"observed_at":"2026-08-01T17:08:57.144237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-01T17:08:57.218943Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:57.218943Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:6bc832d1bada4deaad65ce17f2a4ef18a66ada7648e3bf1194bc37e1c1ccc86f","observation_id":"061eb6bd-9155-4343-b932-18c961abe166","resolution":{"observed_at":"2026-08-01T17:08:57.218943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:57.312106Z","title":"Cross-modal attention fusion network for rgb-d semantic segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:57.312106Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:7d25be71771b550f96de78beaaca02e4b958bd519e362a5e46da34b602bc1403","observation_id":"60edc5db-765e-484b-b8a7-c5eb360f2cdd","resolution":{"observed_at":"2026-08-01T17:08:57.312106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:57.424453Z","title":"Learning rich features from rgb-d images for object detection and segmentation,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:57.424453Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:1fac8e57052329b7538b55e9119826b363cad5a5ab1b498611142cd4240a2f04","observation_id":"7c092f81-6560-4fb2-9eaf-cd55419cc783","resolution":{"observed_at":"2026-08-01T17:08:57.424453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:57.530244Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:57.530244Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:cb5a51d88a20147a2ae2f60924431b3b984360ef9cc44e4c814a94dad72f0733","observation_id":"d595634e-d41d-4724-bb55-cc828d7e5f2f","resolution":{"observed_at":"2026-08-01T17:08:57.530244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:57.619967Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:57.619967Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:b26bc5aa8a00ff474f7cdb892d204139af576d32a4c16c773983c31fd764c9a0","observation_id":"6377bd19-00ab-4240-a3d4-7a6c9c5eb0d7","resolution":{"observed_at":"2026-08-01T17:08:57.619967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:57.697759Z","title":"Cgnet: A light- weight context guided network for semantic segmentation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:57.697759Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:75925aa5455637cf34982e772eb20b91978d76e4576847fd4e446bb8b9eaa8a0","observation_id":"4ce48b8e-722c-47ee-94d8-90b61ed4529d","resolution":{"observed_at":"2026-08-01T17:08:57.697759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:57.798943Z","title":"Yale-cmu-berkeley dataset for robotic manipulation research,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:57.798943Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:bee888b0901af065d673576ab723df602197c73ca1113a60e1b5e28520466b8d","observation_id":"0fb6cfc6-4aa1-45d3-80ce-25600ab2006e","resolution":{"observed_at":"2026-08-01T17:08:57.798943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:57.864111Z","title":"6-dof pose estimation of household objects for robotic manipulation: An accessible dataset and benchmark,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:57.864111Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:39dceaa50d216acea054434cef8878cf5da2f1641e7da07c9fbc73777d86916e","observation_id":"e8141791-dd43-411b-a708-e4c66332a978","resolution":{"observed_at":"2026-08-01T17:08:57.864111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-01T17:08:57.933116Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:57.933116Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:1e4790f1544b05ffc485fac87eada27ae5b130cf53b6f79b737cd508df506258","observation_id":"22ddafea-f8a3-403f-b4c1-718609108a44","resolution":{"observed_at":"2026-08-01T17:08:57.933116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:08:58.001742Z","title":"V-net: Fully convolutional neural networks for volumetric medical image segmentation,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T17:08:58.001742Z"},"links":{"citing_paper":"/paper/2607.17754"},"observation_digest":"sha256:db53dedf6b3365ab2e136636c4f165d5a00d26e014b2003e78e2978b2d98eae9","observation_id":"d40d0245-3d57-4fcb-921c-eaa3206d12ba","resolution":{"observed_at":"2026-08-01T17:08:58.001742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.17754","last_updated":"2026-07-20T09:47:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-01T17:08:54.482659Z","submitted_at":"2026-07-20T09:47:16Z","title":"DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2607.17754."}