暂无搜索历史
一句话,一个周末,Claude直接把自家最前沿的模型跑在了一台全新的AMD MI355X机架上!
Qwen-Image、HunyuanImage 这些优秀的开源模型,预训练动辄用掉数十亿张图像;而 GPT-Image-2、Nano-Banana-Pro 等闭...
Trevor Darrell,伯克利BAIR联合创始人,他的Caffe深度学习框架曾是计算机视觉领域最广泛使用的平台之一;
但说这话的,偏偏是陶哲轩——13岁IMO金牌,31岁拿下菲尔兹奖,此后近二十年里唯一获此奖的华人。
✨导读:现有无人机多模态大模型只看懂环境、分不清自身运动状态,本文打造SIS-Bench统一评测基准,从「空间认知+自我觉知」双维度分层评估26款主流模型;进一...
多视角生成和视频生成有一个共同的难点:单张图看上去可能都不错,但放在一起就容易“穿帮”。同一个物体换个视角后结构变了,纹理一会儿有一会儿没;视频里主体走着走着形...
2024级硕士研究生赖勇文在王超群副教授指导下,研究成果《AnyStyle: A Single LoRA is Sufficient for Image-Gui...
论文题目:From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vis...
道路异常分割是自动驾驶开放世界感知与安全决策中的基础技术,旨在识别遗落货物、异常障碍物、路面塌陷等未被预先定义的危险目标。近年来,随着深度视觉模型和开放世界感知...
近日,国际顶刊Nature在线发表了一篇题为《人形机器人用于外科手术的活体可行性研究》的论文。该研究将宇树G1人形机器人搬进了手术室,让它握着给人类医生使用的普...
近日,第34届ACM国际多媒体会议(The 34th ACM International Conference on Multimedia, ACM MM 20...
同方知网数字科技有限公司 7 月 15 日发布《知网关于人工智能(AI)署名为作者的论文处理声明》:
近日,东南大学网络空间安全学院23级大三本科生施奕彤,在韦康老师和霍赋硕老师的指导下,完成了关于自监督编码器模型防御窃取的研究工作,成果以第一作者身份被计算机视...
本文介绍了武汉大学行为理解与视觉感知实验室(HUVPR-Lab)在ECCV2026上发表的研究成果。该工作针对以人为中心的音视频联合生成中长期存在的"语音-音...
Transformer依然是当下的绝对主流,但简单套用和魔改已经过时,深度和创新性才是顶会审稿人的菜!比如ACL26上关于局部注意力为何有效的论文。
Project Page: https://xiaobiaodu.github.io/flux-gs-project/ Code(移动端与训练代码均已开源)...
《金融时报》爆料,腾讯正在洽谈成为Manus最大股东。该笔交易的目的是撤销Meta对Manus的收购,参与方是Manus的老股东们,回购价格仍为当初的20亿美元...
近日,计算机图形学与多媒体领域顶级会议ACM International Conference on Multimedia(ACM MM 2026)公布了论文接...
随着三维高斯泼溅(3D Gaussian Splatting, 3DGS) [1] 和神经辐射场(Neural Radiance Fields, NeRF)[2...
6 月初,Google DeepMind Build Day 活动期间,他坐下来,接受了一场完全没有脚本的现场问答,主题是「前沿 AI」。
暂未填写公司和职称
暂未填写个人网址