{"as_of":"2026-08-06T12:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8a0649d6f3c8d341592042f4fdaed295d73d4f1e41f6f0d47a168eae9b9b3097","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T18:37:03.723052Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2512.04733/citation-record","integrity":"/paper/2512.04733/integrity","json":"/paper/2512.04733/citation-record.json","paper":"/paper/2512.04733"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T18:37:01.908488Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:01.908488Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:b21f6397241e9b812581481dd61af66832514dbcf21a11592235c09ef2661ff3","observation_id":"fda3d3f5-307a-4752-a66d-449ce8e0b3ad","resolution":{"observed_at":"2026-08-03T18:37:01.908488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:02.005335Z","title":"Spatial memory: how egocentric and allocentric combine.Trends in cognitive sciences, 10(12):551–557, 2006","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:02.005335Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:d78fd430fb49b56a5d0204acbc643823256525a35f007442f7a5ea8797b965f4","observation_id":"3930f420-ec89-4bba-a6db-9978dd834442","resolution":{"observed_at":"2026-08-03T18:37:02.005335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:02.109624Z","title":"nuscenes: A multi- modal dataset for autonomous driving","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:02.109624Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:38fb16524b2346718b89fa6c18f0d78b9e1cbb449022768bb117c35831439216","observation_id":"3f5eb0eb-53fa-4a73-88f9-2e715c8bba8d","resolution":{"observed_at":"2026-08-03T18:37:02.109624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:02.219643Z","title":"Ground- ing commands for autonomous vehicles via layer fusion with region-specific dynamic layer attention","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:02.219643Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:04e0868842700801907420b3eb1fdc7f85c1541e0559154420584b177a0e7005","observation_id":"78bd2a0e-ab73-42b3-9a4e-9f2fc4e7ce2e","resolution":{"observed_at":"2026-08-03T18:37:02.219643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:02.279160Z","title":"Eeg-based emotion recognition for road accidents in a simulated driving environment.Biomedical signal processing and control, 87:105411, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:02.279160Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:86343ae9afe6fdfb7d809632db151fc9977dff409da2f8687f47aaed82dc7ec9","observation_id":"bf81f2cd-49be-4c04-a5b5-91d480aac5ee","resolution":{"observed_at":"2026-08-03T18:37:02.279160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:02.437211Z","title":"End-to-end autonomous driving: Challenges and frontiers.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:02.437211Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:2fd97f289eca32ee8fad37f0e8b832a6f0f437157a4411690600240fd9132982","observation_id":"f3119527-444e-4e19-93df-4b76e6b6b1e7","resolution":{"observed_at":"2026-08-03T18:37:02.437211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:02.603358Z","title":"Emotion-aware design in automobiles: Embracing technology advancements to enhance human-vehicle interaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:02.603358Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:a0f017b3372d478ebda14aae3efa5b329b5a64b9bc8c499be4bca525bb004b28","observation_id":"e97273e4-b293-4266-ad01-20db6a5b6e70","resolution":{"observed_at":"2026-08-03T18:37:02.603358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:02.702226Z","title":"Emotion recognition in human-computer interaction","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:02.702226Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:9fbebfd363580e0daf721635a5f5cc672145d547c5999670ed7be366f7a0507f","observation_id":"8fead26e-8a64-41b6-a547-2108a5ded26c","resolution":{"observed_at":"2026-08-03T18:37:02.702226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:02.763541Z","title":"A survey on multimodal large language models for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:02.763541Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:c7c7de956c9148ea7ccb52d841dd9b68fc792e8dd384e1349fba91db95b75fb7","observation_id":"cc90a849-5a7d-4dd2-b404-d27223fd6a0e","resolution":{"observed_at":"2026-08-03T18:37:02.763541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:02.862493Z","title":"Com- mands for autonomous vehicles by progressively stacking visual-linguistic representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:02.862493Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:4a8189b40dcedbb38704f8fa713639b5d6c6acf6a569a70cb65f43144764a837","observation_id":"019e1247-76ed-4e72-a0e7-ff8b3c932dd0","resolution":{"observed_at":"2026-08-03T18:37:02.862493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00547","last_updated":"2020-06-03T00:31:11Z","snapshot_observed_at":"2026-07-06T09:16:56.708811Z","submitted_at":"2020-05-01T18:00:02Z","title":"GoEmotions: A Dataset of Fine-Grained Emotions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00547","snapshot_observed_at":"2026-08-03T18:37:02.966502Z","title":"Goemo- tions: A dataset of fine-grained emotions.arXiv preprint arXiv:2005.00547, 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:02.966502Z"},"links":{"cited_paper":"/paper/2005.00547","citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:b8809326980bad718c2e7efb7f7764b93a0fd9623fa76a7b70c8010e0202f60d","observation_id":"61afb2d4-bf7f-4fd5-8f93-9350630c4f55","resolution":{"observed_at":"2026-08-03T18:37:02.966502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.084349Z","title":"Goal- gan: Multimodal trajectory prediction based on goal position estimation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.084349Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:ec946a8c3fc3e8259cc9fe519bec2435a7740c9d423bc9e26e030dc0db88a902","observation_id":"0310f769-0b0b-42aa-92c6-fca76afdb989","resolution":{"observed_at":"2026-08-03T18:37:03.084349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.190418Z","title":"Transvg: End-to-end visual ground- ing with transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.190418Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:8ead561b8f3bd50791e135424d2c739b237eb1c4c6dd5cb9b3cae3197f8bf928","observation_id":"027ec76e-9250-40bb-8e5b-4ccc7bcbfcc3","resolution":{"observed_at":"2026-08-03T18:37:03.190418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.10838","last_updated":"2020-08-26T06:27:52Z","snapshot_observed_at":"2026-07-06T08:24:08.781755Z","submitted_at":"2019-09-24T12:29:27Z","title":"Talk2Car: Taking Control of Your Self-Driving Car","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.10838","snapshot_observed_at":"2026-08-03T18:37:03.277319Z","title":"Talk2car: Taking con- trol of your self-driving car.arXiv preprint arXiv:1909.10838,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.277319Z"},"links":{"cited_paper":"/paper/1909.10838","citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:1e57024b2f0d2c5efcdc72d270b67b396be2fac7edef5e742cd111803c4ac35c","observation_id":"7cf5a902-9b0c-4552-bd15-1edc167ef5fe","resolution":{"observed_at":"2026-08-03T18:37:03.277319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.383485Z","title":"Talk2car: Predicting physical trajectories for natural language commands.Ieee Access, 10: 123809–123834, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.383485Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:a3e923ebd71b5f93826f3211a21b39e8a83cab4140aeec72a137a0f3a273b154","observation_id":"48ec2828-0c7e-4caf-9bf0-c45a3fdf22e8","resolution":{"observed_at":"2026-08-03T18:37:03.383485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.387154Z","title":"Bert: Pre-training of deep bidirectional transform- ers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.387154Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:1a9b112cbbd098ee3892d374fc7b1d19178ebedea8fdc912e42a163b10e50df8","observation_id":"6ee6a772-a3a3-4b65-bc8f-0dcce87a525b","resolution":{"observed_at":"2026-08-03T18:37:03.387154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.390464Z","title":"Multi-class emotion recognition within the valence-arousal-dominance space using eeg","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.390464Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:d031346336447dac0ba516bf0f8e5491da87bb2843798152aea69f4d0290c9db","observation_id":"e2bb7b4e-4696-41ed-9ac7-5d6e908d580f","resolution":{"observed_at":"2026-08-03T18:37:03.390464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.393633Z","title":"Predicting physical world destina- tions for commands given to self-driving cars","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.393633Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:9697d455c489dc7a815e607efb56c290326cec282b29d61ea9f3c2948524da85","observation_id":"5199d07d-9a41-4612-bf56-e1efe1898d34","resolution":{"observed_at":"2026-08-03T18:37:03.393633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.397038Z","title":"Think before you drive: World model-inspired multimodal grounding for autonomous driving.arXiv preprint, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.397038Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:5d7cc1d3377a02896cfe313c3c9956bd88bc5768ca77395776f050d82c6e06ee","observation_id":"6465536a-bedf-4af5-9dfe-15ca353abc0e","resolution":{"observed_at":"2026-08-03T18:37:03.397038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.400130Z","title":"A formal basis for the heuristic determination of minimum cost paths","venue":null,"work_id":null,"year":1968},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.400130Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:d39dca8cff4adc279ae16c5d5717d07929cd3a6580c5f9ca2438d24083ee9e63","observation_id":"7c553ee8-589a-4aec-80f7-c5a42bde8ed6","resolution":{"observed_at":"2026-08-03T18:37:03.400130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.403382Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen- Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.403382Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:d5d625352b58290dea9ba8d52ce063073d2d751d4b99a19b5020a555b168fd72","observation_id":"28f7a811-872f-4ac2-8882-e298d864d099","resolution":{"observed_at":"2026-08-03T18:37:03.403382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.406493Z","title":"Planning-oriented autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.406493Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:a8a91f7b58366cf82ac787ed3e7734ff92027d6c36a6f564ef07e9ed4692091d","observation_id":"0d760349-5e9f-4050-94c3-ecfe12390898","resolution":{"observed_at":"2026-08-03T18:37:03.406493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.409654Z","title":"Think twice before driving: Towards scalable decoders for end-to-end autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.409654Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:b07f4db353f16b6b1eabae5c8290a260586a0d0fc8956429450aab11d4b2698b","observation_id":"a54a34c2-68c5-46c2-9b6b-f432381fbf07","resolution":{"observed_at":"2026-08-03T18:37:03.409654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22313","last_updated":"2024-10-29T17:53:56Z","snapshot_observed_at":"2026-07-31T01:16:26.372370Z","submitted_at":"2024-10-29T17:53:56Z","title":"Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.22313","snapshot_observed_at":"2026-08-03T18:37:03.412774Z","title":"Senna: Bridging large vision-language models and end- to-end autonomous driving.arXiv preprint arXiv:2410.22313,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.412774Z"},"links":{"cited_paper":"/paper/2410.22313","citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:ceddd6acf411a2d3aac6cf799d977eb3f9ea5be6273b50eeb1e6a23be7ca119f","observation_id":"eec9da9d-0c22-4260-bd8e-0d1437df1798","resolution":{"observed_at":"2026-08-03T18:37:03.412774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-07-06T21:49:52.050980Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.24044","snapshot_observed_at":"2026-08-03T18:37:03.416823Z","title":"A survey on vision-language- action models for autonomous driving.arXiv preprint arXiv:2506.24044, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.416823Z"},"links":{"cited_paper":"/paper/2506.24044","citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:cb5fd04af29f11f91819fd4c3718f88b288ad7d06bf3119293a1cb3c10f29acf","observation_id":"92d6ba2c-4203-42ed-9441-008dca2c40cc","resolution":{"observed_at":"2026-08-03T18:37:03.416823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.420264Z","title":"Mdetr-modulated detection for end-to-end multi-modal understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.420264Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:12bf97c685d8b703a4b7e78f9b59005bf33de7f897533f2833aa99f06588c73c","observation_id":"5b53327a-e621-4924-8a82-ebbf3472d915","resolution":{"observed_at":"2026-08-03T18:37:03.420264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.423509Z","title":"Detection of drivers’ anxiety invoked by driving situations using multimodal biosignals.Processes, 8 (2):155, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.423509Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:a7b3669715d1edc62120eb1fef7d8f8891c29d333798f42740493b9e148aaff9","observation_id":"4256fc99-65fb-4313-9b5a-6b539ee99f10","resolution":{"observed_at":"2026-08-03T18:37:03.423509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.426705Z","title":"Review and perspectives on human emotion for connected automated vehicles.Automotive Innovation, 7(1):4–44, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.426705Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:366cdd807583a65dc4bbe6e98156cdc193981b22458f42f81876f8b8d1f3bd87","observation_id":"fb6447ce-1f1f-45a2-88ad-1a2061d42b28","resolution":{"observed_at":"2026-08-03T18:37:03.426705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.12796","last_updated":"2025-12-18T07:25:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-14T17:59:47Z","title":"DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.12796","snapshot_observed_at":"2026-08-03T18:37:03.430100Z","title":"Drivevla-w0: World mod- els amplify data scaling law in autonomous driving.arXiv preprint arXiv:2510.12796, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.430100Z"},"links":{"cited_paper":"/paper/2510.12796","citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:ba8468c2907ebc2644279d8f80522b077b704f1b857d2b89fe96f56409583b7d","observation_id":"41e42b77-c10a-46ce-927d-6d54987d2368","resolution":{"observed_at":"2026-08-03T18:37:03.430100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.433519Z","title":"Fine-grained evaluation of large vision-language mod- els in autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.433519Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:dd10777dd71008cf5b41488c9bd79810a349926313f9a352837b3b730afd0fb8","observation_id":"abfb8096-6550-492a-8eb4-3cd4962bc0d3","resolution":{"observed_at":"2026-08-03T18:37:03.433519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08052","last_updated":"2025-09-29T17:21:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T03:14:04Z","title":"ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08052","snapshot_observed_at":"2026-08-03T18:37:03.436654Z","title":"Recogdrive: A reinforced cognitive frame- work for end-to-end autonomous driving.arXiv preprint arXiv:2506.08052, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.436654Z"},"links":{"cited_paper":"/paper/2506.08052","citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:7ffc4211ed03471e375a45fea27efc42383b04274cddfc0ac74257ac0d19ed4e","observation_id":"592f17f5-0761-4c59-808a-a331ad8325ad","resolution":{"observed_at":"2026-08-03T18:37:03.436654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.440641Z","title":"Steering the future: Redefining intelligent transportation systems with foundation models.Chain, 1(1):46–53, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.440641Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:45b2bfd9a525ae5c18a5d8facb73f2395923eb336f16eb46a41b01230dd528fc","observation_id":"164db171-1c2c-4cef-98a4-e2e067982719","resolution":{"observed_at":"2026-08-03T18:37:03.440641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.444039Z","title":"Mamba-va: A mamba-based approach for continuous emotion recognition in valence-arousal space","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.444039Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:b2faf100572747e1eeb7f5d5590c33e7cb24a47271aaecf6eff7c42d8ac0709d","observation_id":"8ef1f9c2-1860-4c95-98c1-d937321234c6","resolution":{"observed_at":"2026-08-03T18:37:03.444039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.447243Z","title":"Gpt- 4 enhanced multimodal grounding for autonomous driving: Leveraging cross-modal attention with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.447243Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:8f3e42a4a5975488cdf16525dfd8a1aa7ef2ec121a7eefb79da3c8b528d39baa","observation_id":"4c9c1a28-1530-4ffb-aa5c-e9ad2595e409","resolution":{"observed_at":"2026-08-03T18:37:03.447243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.450634Z","title":"Cot-drive: Efficient motion forecasting for autonomous driving with llms and chain-of-thought prompting.IEEE Transactions on Artificial Intelligence, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.450634Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:8fdf673d041bfeec7f10e0b2938f1ea9aff4f327187fface9b73e945d8ede527","observation_id":"c6d9346f-f898-48e6-a30c-4257c43dfce9","resolution":{"observed_at":"2026-08-03T18:37:03.450634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.453786Z","title":"Toward human-like trajectory predic- tion for autonomous driving: A behavior-centric approach","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.453786Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:38d5625ea819d0376b1ecac566988cc549e9bdbd0f8d15df1f6a0afe5c561774","observation_id":"a3ff138e-769d-4c4e-b876-1169c5e1149e","resolution":{"observed_at":"2026-08-03T18:37:03.453786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00789","last_updated":"2026-04-19T12:44:09Z","snapshot_observed_at":"2026-07-06T22:21:14.144525Z","submitted_at":"2025-08-31T10:34:44Z","title":"CogDriver: Integrating Cognitive Inertia for Temporally Coherent Planning in Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00789","snapshot_observed_at":"2026-08-03T18:37:03.457803Z","title":"Omnireason: A temporal-guided vision-language- action framework for autonomous driving.arXiv preprint arXiv:2509.00789, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.457803Z"},"links":{"cited_paper":"/paper/2509.00789","citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:7e38128a6aeca4e0e9df940f04489364eab9557e3ce8b37bd7732141d935180e","observation_id":"60d2c7b5-60f5-452e-be8e-3e76368f64ae","resolution":{"observed_at":"2026-08-03T18:37:03.457803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-03T18:37:03.461246Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection.arXiv preprint arXiv:2303.05499, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.461246Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:a445af2851cb2a3e8611cace9b4938da9aac4d08003e27cdbe26a877e6866b32","observation_id":"59161342-bc84-4f12-a823-d1ec6ea125fe","resolution":{"observed_at":"2026-08-03T18:37:03.461246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-03T18:37:03.464784Z","title":"Roberta: A robustly optimized bert pretraining approach.arXiv preprint arXiv:1907.11692,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.464784Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:c185bc2ca1eaa4c2f7d6977f87fa5355ea4f57f0772d73f999980bffe7e4aa8f","observation_id":"0fc9e669-8ccd-481f-95d9-960a95edf6c5","resolution":{"observed_at":"2026-08-03T18:37:03.464784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.468365Z","title":"C4av: learning cross-modal representations from transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.468365Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:ee82a94857001b44c4881a202907dea4ac4233bbded1448b366d954adc6e855a","observation_id":"2f771d60-f432-4a2a-8fec-9437ea2b5537","resolution":{"observed_at":"2026-08-03T18:37:03.468365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.471618Z","title":"From goals, waypoints & paths to long term human trajectory forecasting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.471618Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:4ba838ba4a42cfb92d653cf0e325465f21d747ed999972f88dfc403e341570f6","observation_id":"d0054764-b0eb-4d7b-b6ab-4420c5b7d1aa","resolution":{"observed_at":"2026-08-03T18:37:03.471618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.475111Z","title":"Person- ality correlates of driver stress.Personality and Individual Differences, 12(6):535–549, 1991","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.475111Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:9e6fd10650f520e27250b470ff3e6d444637ad4e02dcd47e861083ada7122b31","observation_id":"a9b7a4fd-71aa-4af6-980b-00e31e5a78fe","resolution":{"observed_at":"2026-08-03T18:37:03.475111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.478914Z","title":"Attngrounder: Talking to cars with attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.478914Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:5c5fc62dc0399823f64a8fdbf470d048955bb73fac1da41e074bfbb0929e2a4d","observation_id":"05f04bb3-68ce-462f-aa69-0a66b0183311","resolution":{"observed_at":"2026-08-03T18:37:03.478914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.482355Z","title":"Mohammad","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.482355Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:e89516e33b8620085920b9b197d14f5d8b8661d2fe45e2d1cb80f700921c6584","observation_id":"03cdd1aa-9a89-410a-8288-1e5f388a91bc","resolution":{"observed_at":"2026-08-03T18:37:03.482355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.485750Z","title":"Driver emotion recognition with a hybrid attentional multimodal fusion framework.IEEE Transactions on Affective Computing, 14(4):2970–2981, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.485750Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:f1659929d0b7b990f3ff7463ec85c2190ba124851ddb3278a3f942862ecc5b6f","observation_id":"49629f17-eb20-4156-b46b-60bee485f144","resolution":{"observed_at":"2026-08-03T18:37:03.485750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20102","last_updated":"2026-02-08T14:07:58Z","snapshot_observed_at":"2026-08-02T08:33:02.429820Z","submitted_at":"2025-09-24T13:27:35Z","title":"Steerable Adversarial Scenario Generation through Test-Time Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20102","snapshot_observed_at":"2026-08-03T18:37:03.489316Z","title":"Steerable adversarial scenario generation through test-time preference alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.489316Z"},"links":{"cited_paper":"/paper/2509.20102","citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:da4903c8ee6931c702a5c45dc46b6d11ed37c96e05fe8583d6732059adb260de","observation_id":"c2ade741-bd71-42f6-9a97-e89e143b69c6","resolution":{"observed_at":"2026-08-03T18:37:03.489316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.493431Z","title":"Vlp: Vision language planning for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.493431Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:4139ad37421808f9c7814323e57dd8a984009a44f76379d0a11081eccc14329e","observation_id":"ff74b0dc-11e7-4fb4-8cf7-ceefdba0af67","resolution":{"observed_at":"2026-08-03T18:37:03.493431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.496826Z","title":"Multi- modal fusion transformer for end-to-end autonomous driving","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.496826Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:07cabac642abc88d7df714dd9a3c5b844b96d09332ce89e92a0f4430f441b672","observation_id":"20c430bb-5f4c-4996-bb4f-c57b5bb94b18","resolution":{"observed_at":"2026-08-03T18:37:03.496826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.500524Z","title":"Direct prefer- ence optimization: Your language model is secretly a reward model.Advances in neural information processing systems, 36:53728–53741, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.500524Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:29c11faada31bbaaf41c89014601d105678546c68e6e89dec87e144929996a55","observation_id":"4e999f0f-b598-474e-a806-35ba6c449071","resolution":{"observed_at":"2026-08-03T18:37:03.500524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.503797Z","title":"Simlingo: Vision-only closed-loop autonomous driving with language-action alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.503797Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:c7c2f051b219773e67681f5549ee26af279f4642c32ac4bd7dbd68dc0e1b6072","observation_id":"5b2652a7-24d8-4252-ad2a-ef83a9f1461b","resolution":{"observed_at":"2026-08-03T18:37:03.503797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.612115Z","title":"Cosine meets softmax: A tough-to-beat baseline for visual grounding","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.612115Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:5717366619f53cda7888c615e44db1744104a9649caf9833ac36a1d5f75fb606","observation_id":"256c2928-f6fe-44d5-9df8-d866e39e3abc","resolution":{"observed_at":"2026-08-03T18:37:03.612115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-03T03:32:02.223426Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-03T18:37:03.616071Z","title":"Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter.arXiv preprint arXiv:1910.01108, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.616071Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:93c86ccbbf604e1b2ae089f48901f9905adb28e857cec753482c23e928b0a482","observation_id":"abe76bdb-0c96-41cf-a1a9-4d095699d7ca","resolution":{"observed_at":"2026-08-03T18:37:03.616071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.620338Z","title":"Vision-language-action models: Con- cepts, progress, applications and challenges.arXiv preprint arXiv:2505.04769, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.620338Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:f490f5bc1d4f32ba81b143fd7292ea8dbfc1688913e3cfa19211ac9aae511ce4","observation_id":"a842e73d-7073-4107-b7f5-8bc6be2131ab","resolution":{"observed_at":"2026-08-03T18:37:03.620338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.623869Z","title":"Lmdrive: Closed-loop end-to-end driving with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.623869Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:3a4fb34aee21396a18a7d84fe0e9954bfa86df7be8e52444c778e47155c84078","observation_id":"d67903a5-2881-420e-95f2-bdf2fe0ec06d","resolution":{"observed_at":"2026-08-03T18:37:03.623869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.627230Z","title":"Passengers’ emotions recognition to improve social acceptance of autonomous driving vehicles","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.627230Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:e94a7f5a65c4713e47f9b93ce6e151bc35f08369501668a0877609af05313afe","observation_id":"f6d03268-3e61-40e2-8949-3e88c917dd00","resolution":{"observed_at":"2026-08-03T18:37:03.627230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.630523Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.630523Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:6bb8e3f629861ae90f6e0c00cb6a66dba78ffc01c25e302f974b6b594322199c","observation_id":"fbf56c07-0f16-4392-b907-4f3182384d97","resolution":{"observed_at":"2026-08-03T18:37:03.630523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04952","last_updated":"2025-03-06T20:31:11Z","snapshot_observed_at":"2026-08-01T16:12:19.989151Z","submitted_at":"2025-03-06T20:31:11Z","title":"INTENT: Trajectory Prediction Framework with Intention-Guided Contrastive Clustering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04952","snapshot_observed_at":"2026-08-03T18:37:03.633960Z","title":"Intent: Trajectory prediction framework with intention-guided contrastive clustering.arXiv preprint arXiv:2503.04952, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.633960Z"},"links":{"cited_paper":"/paper/2503.04952","citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:94ccdf7315bee17d5208fbb2d292ecb5a270c8853cd0e74dd9b122aace96240f","observation_id":"d40fc4b8-12d8-4a05-b005-a8fb31a050b6","resolution":{"observed_at":"2026-08-03T18:37:03.633960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.638292Z","title":"Itinera: Integrating spatial optimization with large language models for open-domain urban itinerary planning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.638292Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:4b653b31a1d6e3d1c470e9377803600651f8167ee587594466ba0e4d6586664a","observation_id":"d9d6a883-fd90-4a5b-9392-20ed204e4cf2","resolution":{"observed_at":"2026-08-03T18:37:03.638292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.641894Z","title":"Sparkle: Mastering basic spatial ca- pabilities in vision language models elicits generalization to spatial reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.641894Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:13d514827b0d33f2f9a5d8318f6ebe0c90d05be0a4d4fcf1382efb486c9875b2","observation_id":"30554d7a-e70d-4187-85ce-ff7241a42a1f","resolution":{"observed_at":"2026-08-03T18:37:03.641894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.645153Z","title":"Qwen2.5: A party of foundation models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.645153Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:d210a42cb1a41fb1d879227a5457f9fe73947c12ed1024c4387a1317a4a8cc84","observation_id":"10022ae3-0336-4784-9de6-11b413574c57","resolution":{"observed_at":"2026-08-03T18:37:03.645153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12289","last_updated":"2024-06-25T17:55:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-19T17:04:04Z","title":"DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12289","snapshot_observed_at":"2026-08-03T18:37:03.648353Z","title":"Drivevlm: The convergence of autonomous driving and large vision-language models.arXiv preprint arXiv:2402.12289, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.648353Z"},"links":{"cited_paper":"/paper/2402.12289","citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:1b5ceb0dc4e7940e952401ded14cf6e5c5ad3cb1a59dc17250361da13eceacfe","observation_id":"35b882d3-cab5-4e4e-b808-08a621e0b176","resolution":{"observed_at":"2026-08-03T18:37:03.648353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.652297Z","title":"Fcos3d: Fully convolutional one-stage monocular 3d object detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.652297Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:15bce96bfae6a938692884abd9e6770ecf52b335799da91363d67cbe76501151","observation_id":"c5553fd1-8fd6-4f19-8c6c-fefd928b9fff","resolution":{"observed_at":"2026-08-03T18:37:03.652297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.655497Z","title":"Norms of valence, arousal, and dominance for 13,915 english lemmas.Behavior research methods, 45(4):1191–1207, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.655497Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:c3c748a6532b09a12a313b78f1bc54454141fd8a5c2532d9b4bb74da1fbc551c","observation_id":"7ba7e06a-745a-49c2-993e-e5e6d01981db","resolution":{"observed_at":"2026-08-03T18:37:03.655497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.658743Z","title":"Driver multi-task emotion recognition network based on multi-modal facial video analysis.Pattern Recognition, 161:111241, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.658743Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:ff72842a17346933cf8748b4944f5dfd8f7c85e4ff9562452bb74d6d68b74cae","observation_id":"56127d28-9105-43bf-af44-7341389924db","resolution":{"observed_at":"2026-08-03T18:37:03.658743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.662544Z","title":"On-road driver emotion recognition using facial expression","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.662544Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:713bd9ce5adfc3535cbb89de1a1b7d21a04d1a852af78f993d06e0695900f012","observation_id":"d491ecf8-b5e0-4cdb-bbd9-661ba2b095e0","resolution":{"observed_at":"2026-08-03T18:37:03.662544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.666081Z","title":"Openemma: Open-source multimodal model for end-to-end autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.666081Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:106cffe974fa519683839e51db9768b227f8b20a8d5bdfb38bd364c8b5a7374a","observation_id":"a8df3031-c179-468b-a047-002ae3d4dda9","resolution":{"observed_at":"2026-08-03T18:37:03.666081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.669450Z","title":"Drivegpt4: Interpretable end-to-end autonomous driving via large language model.IEEE Robotics and Automation Letters,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.669450Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:0b6b0096bda1f60957346b9d7dd2f278d96cb3a56b8b0bbbce982177c24467ff","observation_id":"e920f7bb-0f9f-47b3-b03a-e7966eac6164","resolution":{"observed_at":"2026-08-03T18:37:03.669450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.673056Z","title":"Universal instance percep- tion as object discovery and retrieval","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.673056Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:b769da489bb997e6a2d52da6f448c07423a306dd2e9800ea08f3c5476a8782c9","observation_id":"57368989-594c-4a39-92c1-b4a11fd4e1b7","resolution":{"observed_at":"2026-08-03T18:37:03.673056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-03T18:37:03.676510Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.676510Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:c8227e174de72ade03aac4dadc4e90a740760a49bce89f7e97266c40fed334bf","observation_id":"f248a8d4-07d8-47b3-8598-9cbcfd693439","resolution":{"observed_at":"2026-08-03T18:37:03.676510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.680731Z","title":"Improving visual grounding with visual- linguistic verification and iterative reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.680731Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:96dfa4362c8e343ad8054d74b312128be76f8040b0047130f19ae31635d4917f","observation_id":"ac44f8ca-786f-4e25-8077-9458c741cf1c","resolution":{"observed_at":"2026-08-03T18:37:03.680731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.683912Z","title":"Human-centric autonomous systems with llms for user command reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.683912Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:c6f9ee92e88388af969ac2504b4717bbcf3673e1f76792101c07b9e8cc5365a0","observation_id":"df25b92d-630e-429d-ab14-b1fb7eb07d31","resolution":{"observed_at":"2026-08-03T18:37:03.683912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16278","last_updated":"2026-05-18T09:58:49Z","snapshot_observed_at":"2026-08-01T11:49:26.764186Z","submitted_at":"2025-05-22T06:23:04Z","title":"DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16278","snapshot_observed_at":"2026-08-03T18:37:03.687072Z","title":"Drivemoe: Mixture-of-experts for vision-language-action model in end- to-end autonomous driving.arXiv preprint arXiv:2505.16278,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.687072Z"},"links":{"cited_paper":"/paper/2505.16278","citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:19356a68d1f9b7be3abc8096200aa20000c5828c9273d4e2fc058c3fc8836676","observation_id":"9a493113-acd6-4c4d-9a47-74bd8c9ed12d","resolution":{"observed_at":"2026-08-03T18:37:03.687072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17685","last_updated":"2025-11-11T01:31:25Z","snapshot_observed_at":"2026-08-02T20:06:32.255780Z","submitted_at":"2025-05-23T09:55:32Z","title":"FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17685","snapshot_observed_at":"2026-08-03T18:37:03.691579Z","title":"Futuresightdrive: Thinking visually with spatio-temporal cot for autonomous driving.arXiv preprint arXiv:2505.17685, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.691579Z"},"links":{"cited_paper":"/paper/2505.17685","citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:0d40d6774545926dcff369831bcff55b0f177332496d40663d0db909799ca03b","observation_id":"c879d654-0663-40b5-8dab-f2bc31a67832","resolution":{"observed_at":"2026-08-03T18:37:03.691579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.695032Z","title":"Driver emotion recog- nition for intelligent vehicles: A survey.ACM Computing Surveys (CSUR), 53(3):1–30, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.695032Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:36f4f052d81b377e64e9c4d39eaf0529077eff479e3b1895f340a646f97840eb","observation_id":"c8bcc00f-788b-4981-8cf3-7d8698cdcf5c","resolution":{"observed_at":"2026-08-03T18:37:03.695032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.698581Z","title":"A comprehensive review: Multisen- sory and cross-cultural approaches to driver emotion modula- tion in vehicle systems.Applied Sciences, 14(15):6819, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.698581Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:0b8fa253e423b0372611c2018f64bb1891de77784a5dd9d2288c839799c8adb6","observation_id":"16d9c207-6e28-4112-8af1-63f59e52c853","resolution":{"observed_at":"2026-08-03T18:37:03.698581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05176","last_updated":"2025-06-11T02:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-05T15:49:48Z","title":"Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05176","snapshot_observed_at":"2026-08-03T18:37:03.702348Z","title":"Qwen3 embedding: Advancing text embedding and reranking through foundation models.arXiv preprint arXiv:2506.05176, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.702348Z"},"links":{"cited_paper":"/paper/2506.05176","citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:1ff360d513128291b0fc663fbbecdb070f849efa139922dc80d02f602b2331fa","observation_id":"bb611e13-b34c-4555-98e3-7ddbec524471","resolution":{"observed_at":"2026-08-03T18:37:03.702348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.706019Z","title":"Where are you heading? dynamic trajectory prediction with expert goal examples","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.706019Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:31bc7d356cf868588bf25a15c15f359eeb060902b375493bdbfebd5f1fddd465","observation_id":"856c9ebf-1b38-403c-a2ad-acd307f91a9b","resolution":{"observed_at":"2026-08-03T18:37:03.706019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.709280Z","title":"A survey of autonomous driving from a deep learning perspective.ACM Computing Surveys, 57(10): 1–60, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.709280Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:0fa5cc69158653bdb80ac0bb93cd98d35c061b3cf81e7aae6345551a69923be9","observation_id":"aa69a70c-2cb0-4265-b9f6-cef9f6ce925a","resolution":{"observed_at":"2026-08-03T18:37:03.709280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05517","last_updated":"2025-05-19T06:50:53Z","snapshot_observed_at":"2026-08-05T14:11:37.629456Z","submitted_at":"2024-08-10T11:00:13Z","title":"SWIFT:A Scalable lightWeight Infrastructure for Fine-Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05517","snapshot_observed_at":"2026-08-03T18:37:03.712885Z","title":"Swift: A scalable lightweight infrastructure for fine-tuning.arXiv preprint arXiv:2408.05517, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.712885Z"},"links":{"cited_paper":"/paper/2408.05517","citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:675c81e42434f39a5b595a2ac45f495b8cdeb5ee2ac276661229fb53f0845d6a","observation_id":"bc8fa26b-b8f8-42de-abaf-658eaddfb799","resolution":{"observed_at":"2026-08-03T18:37:03.712885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.716364Z","title":"Opendrivevla: Towards end-to-end au- tonomous driving with large vision language action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.716364Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:d84b4b03242eb5ad5ae051112e9dd43a599227ec5f41da094830bc285b8bd786","observation_id":"cc32ee54-49b4-4926-87e2-6842f53a717b","resolution":{"observed_at":"2026-08-03T18:37:03.716364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.719804Z","title":"Autovla: A vision- language-action model for end-to-end autonomous driving with adaptive reasoning and reinforcement fine-tuning.Nips,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.719804Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:1aa2b1c2be8c842c4b029b6b4e907d5633de717fc8f3f0c7cb3f4d3de8da7a00","observation_id":"f62ba2de-e9a0-453b-86ab-82f5d5704bc7","resolution":{"observed_at":"2026-08-03T18:37:03.719804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:37:03.723052Z","title":"Exclamation Boost","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:03.723052Z"},"links":{"citing_paper":"/paper/2512.04733"},"observation_digest":"sha256:cac519c187fa580ecdf1f83d1d57a035bb884f4799d1559281b11a7c53492870","observation_id":"4ab534f4-0210-41bc-b28c-7bfe8b733aee","resolution":{"observed_at":"2026-08-03T18:37:03.723052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.04733","last_updated":"2026-05-28T14:42:29Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T14:12:49.288484Z","submitted_at":"2025-12-04T12:17:25Z","title":"E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":82,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 0 inbound Pith citation observations for arXiv:2512.04733."}