{"as_of":"2026-08-07T17:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a1929f74fc0e299d183bf7310b39cb03ba1302324812dbed59a1f138571a816a","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T13:09:16.091741Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.04812/citation-record","integrity":"/paper/2607.04812/integrity","json":"/paper/2607.04812/citation-record.json","paper":"/paper/2607.04812"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Intentnet: Learning to predict intention from raw sensor data,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:74a64e166e6895818f39b42aedb48c06944f1c2c0b403a2f95d11afb7d854d37","observation_id":"3921291e-4caa-4e84-b5c8-489c48bd2c8c","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.05449","last_updated":"2019-10-12T00:34:37Z","snapshot_observed_at":"2026-08-04T23:16:21.521818Z","submitted_at":"2019-10-12T00:34:37Z","title":"MultiPath: Multiple Probabilistic Anchor Trajectory Hypotheses for Behavior Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.05449","snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Multipath: Multiple probabilistic anchor trajectory hypotheses for behavior prediction,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"cited_paper":"/paper/1910.05449","citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:f3b17f291b12e9103beefaba24f769548d57c744b7bf97c4857a9cb82695db4c","observation_id":"e66280e1-5c93-4b6d-80ac-7c8d04062adc","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Efficient baselines for motion prediction in autonomous driving,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:97ff46a8ca40ceeb74862fd0de68ef7d157910dd15ed92a79688f28327cab93a","observation_id":"53338978-2e88-4a97-8549-b3db41fb7110","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"FIERY: Future instance segmentation in bird’s-eye view from surround monocular cameras,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:b39456f706afdf94890883ee1f480238e0c737142562c1ec8731b2b231808cc2","observation_id":"61cc1232-bf73-4d86-bef7-d870ec9fd81a","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Powerbev: A powerful yet lightweight framework for instance prediction in bird’s-eye view,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:7efb2b5fb99dcdc81c2d892c542ee59f8f074c3572b1e2f435db5285eec9ff30","observation_id":"2734260b-57c0-4945-8996-f088bacb003f","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Fast and efficient transformer- based method for bird’s eye view instance prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:0d741b49c32f9c664596030498638927b9a12e787f3e03d436fda3139d85c55b","observation_id":"709f2c87-d141-407b-9f10-14f0f507d032","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:49440102c19b25a1c9096078f4e7d30b4518fe08e59e35cd29fa831f2e9dd283","observation_id":"8fb7bc6e-0006-4e34-b8b8-e1b5d61f965d","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:f87b14312ba35c2dea8042379f771930ad35aa21a2f6a254c1c5dbf0d7b260b8","observation_id":"8ba7f202-ceaf-40de-a416-636d5055e4ec","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Pop-3d: Open-vocabulary 3d occupancy prediction from images,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:823a32335760376d712c6ecc236023b62a3f357ef9255f2902786335bf720bfc","observation_id":"24bb9ffc-2a5d-4111-9562-02feec16e6db","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.11027","last_updated":"2020-05-05T09:13:24Z","snapshot_observed_at":"2026-07-06T07:41:49.415532Z","submitted_at":"2019-03-26T17:19:56Z","title":"nuScenes: A multimodal dataset for autonomous driving","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.11027","snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"nuscenes: A multimodal dataset for autonomous driving,","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"cited_paper":"/paper/1903.11027","citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:f6654e6a80be5ca3be263aa880c6a23f3b1c7d39293b628799f1eb69aef48ea2","observation_id":"0a82a82b-2dbc-491f-aa48-3b322082a27c","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:14df3497dc91ca07fe550483fbbfb528b139805e03f1308a33eb5959d3ac0e9f","observation_id":"0d2b35cb-3803-4f96-8640-ebafca303d44","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:8016fb6dfeb5fbe7c9f9c345c85e1df90fe4390ff7c83044b7d242a224b7890a","observation_id":"7f557005-6f63-4a70-8a5c-d0dcd2bea5db","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:1f59b4c4433963cf6c161bbae31e808e34869432bbb4c3bb9680865288b2ccb0","observation_id":"74775c49-3507-45e3-ab64-5161072d25fb","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Maskclip: Masked self-distillation advances contrastive language-image pretraining,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:c8642ca6157b3f339215cfc2f681867e6ac6272c762089082bd775898e830547","observation_id":"d84e936c-4ab5-4f6b-944a-5ab7f77cc296","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Zegclip: Towards adapting clip for zero-shot semantic segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:def0c8f236744d19447ee12a0a0dd6bc8c1af507692375e2d7daa2ffadd5f051","observation_id":"6cbdde72-e9e7-413b-801f-24cf06d0d4c8","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Emerging properties in self-supervised vision transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:f7a1744275b8f522495ec9e7de9547cdd915fb5a9717c8fd60859070fae2055f","observation_id":"4f2bc3d3-b42c-4fbf-9c84-4ebb9c8526c8","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:5fccc1908b59708bf5a919fab9b2c1aea01da53c5bec111f5dd271dba365c709","observation_id":"e670de08-2844-4363-b910-bf956e78cae9","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-07-06T22:12:35.584339Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Siméoni, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:6ccbc8dfdcf733253ac505deb7e63da7e18e0ae049dd8b80b5f2c6d689ce70db","observation_id":"680bd8ac-e051-44d2-b0d3-9ff091083a12","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Sam 2: Segment anything in images and videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:6f0c51827323dc3d3c6a63363e8694397c3d42d748804f78b321d90ce4dc87f2","observation_id":"e3d73cad-fb8c-470b-bd91-d24e97297041","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Sam 3: Segment anything with concepts,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:8eba927ca0f40452088264d3e06565664813d7e235ec1a117d6e72e6d6655b7f","observation_id":"dc6bf809-671c-4b02-8de0-ebdfcff047c1","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:7e7976f3ed18c05552c74c6abb742b9ca4c04a7dadac18be2a808396f11de0d5","observation_id":"c9c97a69-7ed4-4510-a386-2defd39581cf","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.04720","last_updated":"2026-01-19T09:03:26Z","snapshot_observed_at":"2026-07-06T22:41:05.793337Z","submitted_at":"2026-01-08T08:36:06Z","title":"Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.04720","snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Qwen3-vl-embedding and qwen3-vl-reranker: A unified framework for state-of-the-art multimodal retrieval and ranking,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"cited_paper":"/paper/2601.04720","citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:89b16f383480d6913a0c24bf641fc6cf47b029ab75426782143b60495198ef69","observation_id":"4603b61e-b8c0-42a3-a6c0-b537cabd0cda","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Expanding performance boundaries of open- source multimodal models with model, data, and test-time scaling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:29dfcde389bc2dd556ebfe9685c4247a4c7ea6e72ed205f8ab7d9ba5274580c8","observation_id":"95c717bc-5e48-4cbb-9cf7-b96077342bae","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:b37dfd4194e3e0281b7d3d5ef1069901bda93099431795ad18e026086a8a09e2","observation_id":"5dd3991a-3ea1-44e4-a132-2826b675b821","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Openworld- sam: Extending sam2 for universal image segmentation with language prompts,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:95de5754d831cbb0ee2edad1df0b1dd543274535563e0418a235e63b211bedb4","observation_id":"cd5a015d-154a-4491-b36b-8f3b51b74012","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Lposs: Label propagation over patches and pixels for open-vocabulary semantic segmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:13558c3c9c8271d13cd90c8e48dbfba5f8e504aa371f4bf768fb00f7b674131c","observation_id":"ae0ec5f4-c605-4f68-bed1-1c55a22e3af6","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Tri-perspective view for vision-based 3d semantic occupancy prediction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:5b86a3cfeb7452c5b2b1be3161399c1544b8f1850a06efde77b158f4b0a8ddc8","observation_id":"6d11d4e9-86cd-47cb-940a-72b87e18d0af","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Occformer: Dual-path transformer for vision-based 3d semantic occupancy prediction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:24cf48edd8c85131593b1724a492b673d3e6d90d3fc0dbad1e3ca738d3f336bd","observation_id":"2f537d4e-49e0-4a39-b652-d70b0a77a5f9","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16133","last_updated":"2023-06-14T17:30:54Z","snapshot_observed_at":"2026-07-06T15:33:23.984280Z","submitted_at":"2023-05-25T15:07:25Z","title":"OVO: Open-Vocabulary Occupancy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16133","snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Ovo: Open- vocabulary occupancy,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"cited_paper":"/paper/2305.16133","citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:63643017af786649461926f5f820a5b4c1df2af19dff064d88a23649c52ea07b","observation_id":"d271e12f-b085-4d5c-8765-f73768221851","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Talk2bev: Language-enhanced bird’s-eye view maps for autonomous driving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:4f746c903b74e1269c9d633ad4fbdb43ea27bf5cf1148da30c1eff9e7ba7758e","observation_id":"fa287471-8b59-4449-a89a-a10f6b183dff","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Bevformer: learning bird’s-eye-view representation from lidar- camera via spatiotemporal transformers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:9163cf01eaf4e4053bc1110f983079cd4203449de5b1a78784a8d32e121d66fb","observation_id":"7508fd87-3572-45b1-984b-c7c6831cdf9f","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Bevsegformer: Bird’s eye view semantic segmentation from arbitrary camera rigs,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:8f1ab5bd618e4b7a75f181c79713b2d0be95e733a5d802f1aadcc53ad8613821","observation_id":"49d1b76b-1bda-4ef2-bdbb-9fbfba627d9f","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Gaussiancar: Gaussian splatting for efficient camera-radar fusion,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:68e8f4c3486c0c9124676c2be0675abe208744143231f65500833cb20aa25756","observation_id":"0210e984-dcb2-4473-8cad-a42bdbb1eb3d","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Pointbev: A sparse approach for bev predictions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:5cfffe1829dbefd4bccaa3f25257b85ffcc52e57c4b2aedb569ba39d656b2d1f","observation_id":"c7def5a8-c9b9-4ade-a357-67d9b656b04e","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Fb- bev: Bev representation from forward-backward view transformations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:85c1fd3f90338b41c03b02a367985fc9e46b16b6ea8cae63b087827f5030de79","observation_id":"f81a2f64-c9f5-4749-aadc-015305f294c2","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Is ego status all you need for open-loop end-to-end autonomous driving?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:2420b5d973bb8c2099491cdb4e4fbd15dd99c4a36d9bd435d8e967f2407efc72","observation_id":"d78088c5-e12f-4a6d-9cea-82555afdc2af","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Lmdrive: Closed-loop end-to-end driving with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:57fcc41f6b7273730e9cdef3b5abfdde97b12af52ad21382240f83d73fdb1383","observation_id":"0fcdcda7-f56a-4aba-8a53-588e19ab186b","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03074","last_updated":"2025-03-05T00:27:32Z","snapshot_observed_at":"2026-08-07T17:29:01.212505Z","submitted_at":"2025-03-05T00:27:32Z","title":"BEVDriver: Leveraging BEV Maps in LLMs for Robust Closed-Loop Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03074","snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Bevdriver: Leveraging bev maps in llms for robust closed-loop driving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"cited_paper":"/paper/2503.03074","citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:a87050a9ad8abd1c8dd2324935caadbdcee818cf382132d75cb4a63676dc6dae","observation_id":"d78f862e-e468-49b8-a8a9-7aec7fb333e9","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Safety-enhanced autonomous driving using interpretable sensor fusion transformer,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:d6db67da706e6c3573e6a5f47e917e1c02fe853da579d159071a363fb06feeae","observation_id":"71531627-045e-4352-851c-aa9100e5aafe","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Reasonnet: End-to-end driving with temporal and global reasoning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:6ad1b4aa4be8906f10d49e877ecb536461f63e867575e28297c10377f4f3ef7d","observation_id":"3d484879-c3e3-4640-9468-fa183e86bafd","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Vectornet: Encoding hd maps and agent dynamics from vectorized representation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:c1faff761a5fbec78eb534f45c635f5ad64b0586999fa8fc5b3815ca8f2465bf","observation_id":"4dc0a4f8-3440-4985-8760-f612a015dfd1","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Learning lane graph representations for motion forecasting,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:f97c9c4a4b297d493b378b775b44b073f07ee22ce7f583270724efde9232ab7e","observation_id":"7af982be-9dee-4278-934d-7590c2c96c22","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08417","last_updated":"2022-03-04T20:25:25Z","snapshot_observed_at":"2026-07-06T11:19:38.321360Z","submitted_at":"2021-06-15T20:20:44Z","title":"Scene Transformer: A unified architecture for predicting multiple agent trajectories","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08417","snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Scene transformer: A unified architecture for predicting multiple agent trajectories,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"cited_paper":"/paper/2106.08417","citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:e00a845c8d07c91c0f9c4667445fb1fdf34fc3e9d4c10c55cd2c36788eac8262","observation_id":"bfc5475a-f142-43d3-ab72-e7b4b89ba658","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Hivt: Hierarchical vector transformer for multi-agent motion prediction,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:20a64dc6eaa768bf9d8ccc9fac4e3ae7ab892dbac895d767b0efc49981d731e8","observation_id":"07526994-2c71-4a67-8023-37a42a7174fd","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Motion transformer with global intention localization and local movement refinement,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:b6157d6cb5c0f7a87f46ff14d1be382b0e909e425febef2662a820f1897c21c1","observation_id":"3864c6e5-ed82-47c0-8a4e-d2827e2ae8aa","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Query-centric trajectory prediction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:8af3fec2a26592ff69525e2f02d4614cb5a409ec44423f69a5b5a22d25f6dc42","observation_id":"a95697ae-e0cf-480a-8bf5-5ff9d0feca2f","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Vip3d: End-to-end visual trajectory prediction via 3d agent queries,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:3a1a13e8f509ed119fd64201352eaa88877509d9813a355056d51a9474b9c8fa","observation_id":"ad10ffbe-2458-40cd-8830-15197e6f4eb4","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Detra: A unified model for object detection and trajectory forecasting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:fa3e5e3f64645e3c81bfaf1acb703c290c2fab7fb98b819bf4cc7cff10285ef0","observation_id":"8568be9b-3466-4aa9-8321-1af372421a78","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09743","last_updated":"2022-05-19T17:55:35Z","snapshot_observed_at":"2026-08-04T03:03:57.465654Z","submitted_at":"2022-05-19T17:55:35Z","title":"BEVerse: Unified Perception and Prediction in Birds-Eye-View for Vision-Centric Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09743","snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Beverse: Unified perception and prediction in birds-eye-view for vision- centric autonomous driving,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"cited_paper":"/paper/2205.09743","citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:d917cdacb41af6dd4fabbfc61eb049d7d1d70fa9909c923b34698fcfedf39f24","observation_id":"e89f1159-f755-423c-bc49-539ce8763614","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Stretchbev: Stretching future instance prediction spatially and temporally,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:d9f0734542d61b3ab02d63d167eb40b21ba0e143936c49a747d75e60cf44c11d","observation_id":"c476862e-1f45-4998-9102-d6fe456a7cef","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"St-p3: End-to-end vision-based autonomous driving via spatial-temporal feature learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:e5ea20115910fc3df9e47f44e4ac30a30539702e2dcc771a02650c3bdd92f841","observation_id":"ec62347d-6be3-4cc0-9f28-9e7a1f2ce359","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Dmp: Difference-guided motion prediction for vision-centric autonomous driving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:ebbb83db37e5fd70298137440f702e0571ca156dfe0ed5815f55c4683f120cc2","observation_id":"b0427ed1-77a7-460b-b9a0-0698cf148789","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.02930","last_updated":"2026-04-03T09:58:42Z","snapshot_observed_at":"2026-07-06T22:52:10.923214Z","submitted_at":"2026-04-03T09:58:42Z","title":"BEVPredFormer: Spatio-temporal Attention for BEV Instance Prediction in Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.02930","snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Bevpredformer: Spatio-temporal attention for bev instance prediction in autonomous driving,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"cited_paper":"/paper/2604.02930","citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:48af3c661da00ccea50530d3009b066958131ebef340ad5999f6131ae9de7fff","observation_id":"60fbeb17-931b-4f24-af3b-df011f6dc5d4","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"Efficientvit: Memory efficient vision transformer with cascaded group attention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:5c2ae24e6ae95535bcb809a5aa58c01e396f09ea3a0356de0998a08663eadb35","observation_id":"4c762c00-d2a9-4bef-a0fd-1275d08116a5","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:09:16.091741Z","title":"St-p3: End-to-end vision-based autonomous driving via spatial-temporal feature learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-11T13:09:16.091741Z"},"links":{"citing_paper":"/paper/2607.04812"},"observation_digest":"sha256:91f3439c8ffdbd52f3dc9c562d89e3a6f784988bceb4b84f95c6809311168d94","observation_id":"baab87fe-4eb1-4308-9e39-0041a567294b","resolution":{"observed_at":"2026-07-11T13:09:16.091741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.04812","last_updated":"2026-07-06T08:47:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T17:31:45.618265Z","submitted_at":"2026-07-06T08:47:56Z","title":"TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2607.04812."}