{"as_of":"2026-08-07T08:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:15bbcfa8ae051df9286976a7a6f39708b5883891ca9a2e029691987a280f6e71","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:59:29.719733Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T08:06:57.772386Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":"2406.20076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-07-10T08:06:57.772386Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":"cs.CV","work_id":"9c74bfe1-f3f0-49c7-b929-3627d1d4fc12","year":2024},"citing_paper":{"arxiv_id":"2412.08110","last_updated":"2026-05-07T17:14:28Z","snapshot_observed_at":"2026-08-02T20:28:50.583436Z","submitted_at":"2024-12-11T05:36:18Z","title":"The ART of Composition: Attention-Regularized Training for Compositional Visual Grounding","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-23T07:24:01.527093Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2412.08110"},"observation_digest":"sha256:dda0acb1c489b01530edf5fef3effb1bfc457fce93341416bd5e37c851b2e95e","observation_id":"5c63839f-a28c-486d-b7c6-d57edf0e1e06","resolution":{"observed_at":"2026-05-23T07:25:28.430275Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":"2406.20076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-07-10T08:06:57.772386Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":"cs.CV","work_id":"9c74bfe1-f3f0-49c7-b929-3627d1d4fc12","year":2024},"citing_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-07-06T20:17:47.599899Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"reference_index":118,"source":"pdf_text","source_observed_at":"2026-05-16T11:39:22.340737Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2501.04001"},"observation_digest":"sha256:ca0319a4f6dd8e29e69531dc6d9b9066450a582c35f08c5f097e963226644bc3","observation_id":"ba6c847b-5d56-4dda-ab62-a23bebb4c965","resolution":{"observed_at":"2026-05-16T11:39:22.556638Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-08-07T05:59:29.719733Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:29.719733Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:4d5c4827c697acf14d24bb7db83c9814e41f92c92905cb6808d627600dd83eee","observation_id":"6c734f9e-ea84-4ac8-a2e5-80d9356fc318","resolution":{"observed_at":"2026-08-07T05:59:29.719733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-08-06T22:40:36.054758Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21006","last_updated":"2025-06-26T04:46:28Z","snapshot_observed_at":"2026-08-06T22:33:39.255266Z","submitted_at":"2025-06-26T04:46:28Z","title":"Detection of Breast Cancer Lumpectomy Margin with SAM-incorporated Forward-Forward Contrastive Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:36.054758Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2506.21006"},"observation_digest":"sha256:894954f0876e22f743ed876a7f7e42c678982f90979cedd13d726f17918cf5ea","observation_id":"cb421d72-2444-4831-b123-426b0b3e7b25","resolution":{"observed_at":"2026-08-06T22:40:36.054758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-08-06T21:54:43.687107Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23121","last_updated":"2025-07-14T02:03:48Z","snapshot_observed_at":"2026-08-06T21:46:18.776144Z","submitted_at":"2025-06-29T07:05:27Z","title":"CRISP-SAM2: SAM2 with Cross-Modal Interaction and Semantic Prompting for Multi-Organ Segmentation","version":3},"reference_index":126,"source":"pdf_text","source_observed_at":"2026-08-06T21:54:43.687107Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2506.23121"},"observation_digest":"sha256:5117a3834b5a1e0e9733a2bd1171dfc8f2c7efd364ce018f848b2e40c3df1d5d","observation_id":"62c7771d-d80f-4243-ae70-dab1685d75c1","resolution":{"observed_at":"2026-08-06T21:54:43.687107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":"2406.20076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-07-10T08:06:57.772386Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":"cs.CV","work_id":"9c74bfe1-f3f0-49c7-b929-3627d1d4fc12","year":2024},"citing_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"reference_index":161,"source":"arxiv_source","source_observed_at":"2026-05-17T20:22:46.220021Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2511.16719"},"observation_digest":"sha256:487e29fb28cc0cbab82413b57ec1bab29bb60b1d3bc0d9e4ee3830d8f702deed","observation_id":"f18181be-c505-4aa3-bef9-046aac89f670","resolution":{"observed_at":"2026-05-17T20:25:11.420980Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":"2406.20076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-07-10T08:06:57.772386Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":"cs.CV","work_id":"9c74bfe1-f3f0-49c7-b929-3627d1d4fc12","year":2024},"citing_paper":{"arxiv_id":"2604.07916","last_updated":"2026-08-04T13:16:24Z","snapshot_observed_at":"2026-08-07T08:19:32.998129Z","submitted_at":"2026-04-09T07:37:09Z","title":"Tarot-SAM3: Training-free SAM3 for Any Referring Expression Segmentation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T18:11:13.376684Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2604.07916"},"observation_digest":"sha256:8dc25bc7a3dcb081b687be0fce8843770144011570a224d01dfab705d737f71a","observation_id":"276b06cd-f6f2-4a4f-a6f1-143db866ae1c","resolution":{"observed_at":"2026-05-11T05:21:01.008627Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":"2406.20076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-07-10T08:06:57.772386Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":"cs.CV","work_id":"9c74bfe1-f3f0-49c7-b929-3627d1d4fc12","year":2024},"citing_paper":{"arxiv_id":"2604.18562","last_updated":"2026-04-22T02:31:50Z","snapshot_observed_at":"2026-08-04T10:02:00.731719Z","submitted_at":"2026-04-20T17:49:22Z","title":"AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-10T05:10:44.608959Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2604.18562"},"observation_digest":"sha256:a4c38020b7c3fbadd2f3198d60a974db9a40f338a9e1e0b3ad5127ff988b7534","observation_id":"0aaeb7f0-5d2e-466a-96bd-bdc82a654fc6","resolution":{"observed_at":"2026-05-10T09:43:49.426512Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":"2406.20076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-07-10T08:06:57.772386Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":"cs.CV","work_id":"9c74bfe1-f3f0-49c7-b929-3627d1d4fc12","year":2024},"citing_paper":{"arxiv_id":"2605.06351","last_updated":"2026-05-07T14:33:14Z","snapshot_observed_at":"2026-08-03T03:28:56.756773Z","submitted_at":"2026-05-07T14:33:14Z","title":"SIGMA-ASL: Sensor-Integrated Multimodal Dataset for Sign Language Recognition","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-05-08T07:04:47.169148Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2605.06351"},"observation_digest":"sha256:41c2dfa30c954a230fb42b3a59ca5984e458add25d1d343d3b3402c2ab662e3f","observation_id":"ad041107-2c10-4d15-b05d-cf91ba74fd24","resolution":{"observed_at":"2026-05-11T21:06:11.352200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":"2406.20076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-07-10T08:06:57.772386Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":"cs.CV","work_id":"9c74bfe1-f3f0-49c7-b929-3627d1d4fc12","year":2024},"citing_paper":{"arxiv_id":"2605.19410","last_updated":"2026-05-19T06:04:23Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T06:04:23Z","title":"Vision Harnessing Agent for Open Ad-hoc Segmentation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:40.429412Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2605.19410"},"observation_digest":"sha256:bcdb1805c4e06765bd0c2394aa655b72d8d1efb9e002ef0401994bf6046f0ed8","observation_id":"fe24e2de-87e2-49c2-b47e-0b30bf539301","resolution":{"observed_at":"2026-05-20T05:53:04.383299Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":"2406.20076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-07-10T08:06:57.772386Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":"cs.CV","work_id":"9c74bfe1-f3f0-49c7-b929-3627d1d4fc12","year":2024},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-07-06T23:30:44.092395Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:1ec263c8442657f072f52e49a1f81d7224088356cb9615a68473485369d741ac","observation_id":"c36a9fb7-f75a-4e05-bf97-86dff3564869","resolution":{"observed_at":"2026-05-20T05:28:05.240709Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":"2406.20076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-07-10T08:06:57.772386Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":"cs.CV","work_id":"9c74bfe1-f3f0-49c7-b929-3627d1d4fc12","year":2024},"citing_paper":{"arxiv_id":"2605.24553","last_updated":"2026-05-23T12:39:37Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:37Z","title":"IQA-Spider: Unifying Multi-Granularity Image Quality Assessment with Reasoning, Grounding and Referring","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T13:28:01.889147Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2605.24553"},"observation_digest":"sha256:53263ebe31fe2f3fd8cacc28ba3284a74ae56bb065c8d5d694b06176985150a6","observation_id":"66b2baea-c095-4da5-8163-0da46a97be86","resolution":{"observed_at":"2026-06-30T13:34:40.563286Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":"2406.20076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-07-10T08:06:57.772386Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":"cs.CV","work_id":"9c74bfe1-f3f0-49c7-b929-3627d1d4fc12","year":2024},"citing_paper":{"arxiv_id":"2605.26102","last_updated":"2026-05-31T07:20:32Z","snapshot_observed_at":"2026-07-06T23:36:01.564747Z","submitted_at":"2026-05-25T17:58:03Z","title":"InstructSAM: Segment Any Instance with Any Instructions","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-29T22:34:00.442420Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2605.26102"},"observation_digest":"sha256:72b28ac4c396cffbf880f932535a921909a3fa86cdc254936084de06cab6033c","observation_id":"0414d691-0d81-40c8-b5b1-36ef31c4b4b9","resolution":{"observed_at":"2026-06-29T22:44:02.029740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":"2406.20076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-07-10T08:06:57.772386Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":"cs.CV","work_id":"9c74bfe1-f3f0-49c7-b929-3627d1d4fc12","year":2024},"citing_paper":{"arxiv_id":"2606.04880","last_updated":"2026-06-02T17:59:57Z","snapshot_observed_at":"2026-08-06T01:54:13.672479Z","submitted_at":"2026-06-02T17:59:57Z","title":"MAOAM: Unified Object and Material Selection with Vision-Language Models","version":1},"reference_index":121,"source":"arxiv_source","source_observed_at":"2026-06-28T11:08:59.900161Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2606.04880"},"observation_digest":"sha256:d421294caadcfe4a578af66ff810f73d8d380948af082527c59150c10bcb5cf7","observation_id":"94431ffb-eb37-4d23-8da3-bd26278c199b","resolution":{"observed_at":"2026-07-02T02:16:26.324793Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":"2406.20076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-07-10T08:06:57.772386Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":"cs.CV","work_id":"9c74bfe1-f3f0-49c7-b929-3627d1d4fc12","year":2024},"citing_paper":{"arxiv_id":"2607.08397","last_updated":"2026-07-09T12:21:06Z","snapshot_observed_at":"2026-08-06T16:27:25.843893Z","submitted_at":"2026-07-09T12:21:06Z","title":"Attribute Retrieving for Open-Vocabulary Endoscopic Compositional Referring Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-10T08:06:03.952787Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2607.08397"},"observation_digest":"sha256:e937c43571d9ade0903feb2744cf93ca756ddaf38c7520eff2d80bd02fa0a3db","observation_id":"5523097c-b5eb-4508-b58f-4697d7e5016d","resolution":{"observed_at":"2026-07-10T08:06:57.773790Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-07-14T04:38:05.237334Z","title":"arXiv preprint arXiv:2406.20076 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11581","last_updated":"2026-07-13T14:00:57Z","snapshot_observed_at":"2026-08-06T16:55:31.542502Z","submitted_at":"2026-07-13T14:00:57Z","title":"Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-14T04:38:05.237334Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2607.11581"},"observation_digest":"sha256:cedcfba82946aca00d5f1cb25b2ee7d28639cbae369dc8ec7dbf2b8f0ece2e15","observation_id":"843ff5ba-65e2-4102-a554-a43190bc32e3","resolution":{"observed_at":"2026-07-14T04:38:05.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-08-06T00:48:46.730648Z","title":"arXiv preprint arXiv:2406.20076 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03147","last_updated":"2026-08-05T06:08:54Z","snapshot_observed_at":"2026-08-07T08:31:49.830686Z","submitted_at":"2026-08-04T05:24:05Z","title":"CROSS: Cascaded Distillation and Dual-Constraint Grounding for Remote Sensing Referring Segmentation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T00:48:46.730648Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2608.03147"},"observation_digest":"sha256:d4301ee50c2fd9ab9b3ca77ee7370e296c49624349ba96b50f05b5cfc3dd8281","observation_id":"77b526f0-3e14-49f8-a679-e6cd4bd18095","resolution":{"observed_at":"2026-08-06T00:48:46.730648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.20076/citation-record","integrity":"/paper/2406.20076/integrity","json":"/paper/2406.20076/citation-record.json","paper":"/paper/2406.20076"},"outbound":[],"paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","latest_version":5,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 17 inbound Pith citation observations for arXiv:2406.20076."}