开启辅助访问 联系我们关于我们文明投稿
关闭窗口

简单4步,开始与 传播网-传播网门户网站(www.icbw.com.cn) - 传播网! 对话吧!

1. 打开你的微信、朋友们选择添加朋友   2. 使用扫一扫功能扫一下上面的二维码
3. 扫描后出现详细资料选择关注就好了   4. 现在开始与我们的官方微信对话吧!

传播网-传播网门户网站(www.icbw.com.cn) - 传播网!

 找回密码
 立即注册

微信登录

微信扫一扫,快速登录

热搜: 活动 交友 discuz
打开微信扫一扫
查看: 879|回复: 0
打印 上一主题 下一主题

斯坦福两学生抄袭清华系大模型,是如何被发现的?对话打假者

[复制链接]

7万

主题

7万

稿子

23万

积分

管理员

Rank: 9Rank: 9Rank: 9

积分
234038
跳转到指定楼层
楼主
发表于 2024-6-5 15:55:52 | 只看该作者 |只看大图 回帖奖励 |倒序浏览 |阅读模式 来自: 四川成都
一则斯坦福大学Llama3-V团队抄袭清华系大模型的消息,近日在海内外引发热议。北京时间4日凌晨,该团队的两名成员Siddharth Sharma和Aksh Garg在社交媒体X上对这一学术不端行为公开致歉,并表示会将Llama3-V模型悉数撤下。
2 j: Q+ F5 S7 Y
- N/ U- ^& E9 i* b3 f# q  据悉,两人是斯坦福大学计算机科学专业的本科生,自称在团队中的角色是模型推广,而负责该项目代码编写的是毕业于南加利福尼亚大学Mustafa Aljadery。事发后,他们要求Mustafa提供原创性证明和训练代码,但未取得任何证据。2 k" s$ ]! x+ f) W8 t1 {8 I$ q
$ n/ t/ u* P$ G' k( X2 O
  4日记者尝试联系率先发现清华系模型被套壳的网友,他表示只是做了一名开源社区工作者应该做的事。此次Llama3-V的抄袭行为,“相当于把可口可乐换成可日可乐就说是自己的项目”。
2 q! @9 _) Y, E/ L0 F  h- @
: _4 y" I1 \6 L6 P  x  针对此事,面壁智能CEO李大海也作出回应,称技术创新不易,呼吁共建开放、合作、有信任的社区环境。
- R, O4 t- ^+ s
* O+ R. O$ I. U: X) Y" J1 i  用不到500美元训练出超越SOTA水平的大模型?
3 \( ~' `; k  L  l# C& P4 V& v
( y& k% M# d/ W) x( Z  z, P: Z  事情起源于5月29日,斯坦福大学AI团队发布Llama3-V开源模型,称它比当前开源SOTA视觉语言模型LLaVA的性能提高了10%-20%,不仅尺寸比GPT-4V小近100倍,而且性能比肩GPT-4V、Gemini Ultra与Claude Opus。 Llama3-V团队声称训练出一个超越SOTA(意为“最新技术”的最佳状态)水平的多模态大型模型,性能比肩多家。
8 A9 R$ S4 ~/ }; ?! p$ I) m. j  U- \0 T; P  }4 H! y5 H
  更重要的是,该大模型的训练成本仅不到500美元。这一惊艳的成果,再加上三位作者出色的专业和技术研发背景,让Llama3-V一经发布就引发各方关注,并一度登上全球最大的开源大模型社区HuggingFace趋势榜第五位。2 [7 W4 u9 Z( ]1 `/ Q
" {- b" w+ C7 ?+ T7 l3 J; \
  不过很快,质疑声便出现。6月2日下午,网友Magic Yang称发现了一个“令人震惊”的事实:Llama3-V项目中有大量疑似抄袭MiniCPM-Llama3-V 2.5的内容,同时晒出了多项Llama3-V涉嫌抄袭的证据。
$ b* o+ Q" l# a
' `" s  K; U0 P+ p8 @" L4 K2 p1 x: N/ F  比如在模型结构和配置文件上,二者高度雷同,只是变量名不同。Llama3-V的代码也几乎完全照抄MiniCPM-Llama3-V 2.5,仅做了一些重新格式化和变量重命名,包括但不限于图像切片、分词器、重采样器、数据加载等变量。 网友晒出Llama3-V涉嫌抄袭的证据。
. l  _* @9 M5 k- J8 f$ j% [: D  GitHub项目信息显示,MiniCPM-Llama3-V2.5共有8B个参数,整体性能超越GPT-4V-1106、Gemini Pro、Qwen-VL-Max和Claude3等专有模型,配备了增强的OCR和指令跟踪能力,还可以支持英语、中文、法语等30多种语言的多模态对话。这款端测多模态开源模型,由清华大学自然语言处理实验室与面壁智能合作开发,于今年5月20日推出。
& l/ w: o2 R' R. S
' W$ |: a! D* t4 z  南都记者尝试联系这位揭露Llama3-V涉嫌抄袭的网友Magic Yang(知乎网名“社恐患者杨老师”),他向南都记者回顾了这场打假的过程。杨老师表示,最近正在帮助一名博士生做有关运动处方的项目,想选择一个质量较好的开源模型作为微调的基座。此前他曾测试了MiniCPM-Llama3-V2.5,因此对MiniCPM的模型架构和代码都相对熟悉。! @. u- W( s2 x1 C' Y9 c$ V
5 k& L' i/ ^6 p5 ]) B# v* y1 F9 W$ c
  后来他注意到,Llama3-V项目在HuggingFace上排名也非常靠前,且获得了相关博主推荐,于是想进一步做测试。但在这过程中,他发现二者在模型架构和代码上存在高度相似的情况,就此询问了Llama3-V作者。结果对方避重就轻,并不正面回应,随后更是将质疑帖子删除,且隐藏了MiniCPM-Llama3-V 2.5的项目主页。; e" K4 u* C( T( b6 N5 C  [; U3 A

; y9 q! @8 `8 k+ |; A  这一系列的操作,令人生疑。6月2日下午,杨老师把所知的证据发到MiniCPM-V的Github项目主页,并提醒面壁智能团队关注。相关对话截图显示,Llama3-V项目作者最初否认抄袭,并称他们的项目开始时间更早,只是使用了MiniCPM-V2的分词器。
7 ~( u' H; N1 I2 j- w. `& c' Y- s
; C7 ]0 }4 g  K: `+ A  杨老师告诉南都记者,作为一个有大模型经验的开发者,发现(抄袭行为)不难,但要证实不易。此事最终一锤定音,还是因为面壁智能团队使用内部数据集“清华简”做了对比测试。
2 e% d8 c% G7 M/ O9 N
  ~6 Z: r( c2 |( @% O* ~  “连错的都一模一样”,确信是套壳
2 B- ]1 |: v! A' ?4 h& `5 o6 h* J% _7 V/ r$ H# P+ e/ S+ P
  南都记者注意到,6月2日深夜,面壁智能团队证实了抄袭行为的存在。经核实,除了社区网友列出的证据外,还发现Llama3-V项目与MiniCP-Llama3-V 2.5一样,可以识别出“清华简”战国古文字,“不仅对的一模一样,连错的都一模一样”。
: y( \0 d/ D2 P/ @1 ~* b: u! \7 r( O1 g! o9 q0 l
  据面壁智能首席科学家、清华大学长聘副教授刘知远介绍,“清华简”的识别能力,是MiniCPM-Llama3-V 2.5研发时内置了一个彩蛋。这是该团队花费数月从清华简逐字扫描,人工标注而来的数据集,并未公开,由此“已经比较确信Llama3-V是对MiniCPM-Llama3-V2.5套壳。” 刘知远的回应。
- U6 h; H, U; ~7 u6 I; F0 i  针对此事,面壁智能CEO李大海也发文称,深表遗憾。“技术创新不易,好的成果希望被更多人关注和认可,但不是以这种方式。”李大海呼吁,大家共建开放、合作、有信任的社区环境。
) `3 m7 z$ n# ~4 Q) |" z) R$ b7 [% H1 q3 n
  刘知远也表示,人工智能的飞速发展离不开全球算法、数据与模型的开源共享,让人们始终可以站在SOTA(意为“最新技术”的最佳状态)的肩上持续前进。这次开源的MiniCPM-Llama3-V 2.5就用到了最新的Llama3作为语言模型基座。! O' E! D1 f: {( H" M& ]

0 z4 Z/ g+ s" t/ \+ u6 `7 H  “开源共享的基石是对开源协议的遵守,对其他贡献者的信任,对前人成果的尊重和致敬,Llama3-V团队无疑严重破坏了这一点。”同时他提到,Llama3-V团队的三位作者中,有两位是斯坦福大学本科生,未来还有很长的路,“如果知错能改,善莫大焉”。0 _/ _4 U# e7 @2 F# d, ]: a* j

0 U; Z0 {0 K6 `% m5 ]( X  北京时间4日凌晨,卷入此次风波的两名斯坦福大学本科生Siddharth Sharma和Aksh Garg在社交平台上解释,称该项目由三人发布,他们只在其中帮忙推广模型,负责代码编写的是Mustafa Aljadery。事发后,他们曾尝试联系Mustafa发布原创性声明,并提供训练代码,但到目前为止还未看到任何证据。在这份联合声明中,两人再次向原作者道歉,并称对未尽职尽责确保Llama3-V的独创性而感到失望,现已将所有对Llama3-V的引用都删除了。 两人联合发文道歉。被推为主要责任方的Mustafa,是团队中唯一的全职成员。其本硕毕业于南加利福尼亚大学,主攻深度学习和数学,是一名软件工程师。截至目前,Mustafa尚未发声。2 l! p; q9 I7 E# E% u" }
0 E& m, C9 y3 Y* j6 u: O, w  V
  两名作者的解释,尚不能平息质疑。斯坦福人工智能实验室主任Christopher David Manning公开发文谴责这一抄袭行为,称两人借口推脱,是拒不认错的表现。- g- \( D' d# N4 [
5 r3 R  ^* u" v9 F
  此番随着原创者也下场打假,这场大模型抄袭风波将暂告一段落。
2 Q" L' ]( y$ i' a
( @+ \3 h  U8 z: A% w
新浪微博 QQ空间
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册 微信登录

本版积分规则

QQ|小黑屋| 传播网-传播网门户网站 ( 蜀ICP备19023435号 )  

GMT+8, 2025-9-13 05:45

Powered by WW.ICBW.COM.CNtechnical support:传播网

川公网安备51010602002315号

快速回复 返回顶部 返回列表