🤖 모델 & 제품 (12/27건)
수학 및 인공지능 자문 위원회
OpenAI는 새로운 AI 결과의 검토 및 커뮤니케이션을 안내하기 위해 독립적인 수학 및 인공지능 자문 위원회와 협력하고 있습니다.
Higgsfield AI, GPT-6 Astra로 하루 만에 새로운 비디오 기능 출시
GPT-6 Astra를 통해 Higgsfield AI는 소상공인을 위한 비디오 광고 제작을 더 쉽게 만들고 새로운 크리에이티브 도구를 더 빠르게 시장에 출시합니다.
AI의 다음 단계를 위한 빌딩 표준
OpenAI는 안전성 향상을 위해 조정된 평가, 보고 및 거버넌스를 요구하며 공유된 글로벌 AI 표준을 향한 경로를 제시합니다.
새로운 학습 경로로 OpenAI Academy 확장
직원, 개발자, 리더, 교육자 및 학생을 위한 새로운 OpenAI Academy 학습 경로를 탐색하여 실질적인 AI 기술을 구축하고 시연하세요.
V7이 AI 에이전트에 기관 메모리를 제공하는 방법
GPT-5.6을 사용하여 V7은 흩어져 있는 회사 파일을 에이전트가 복잡하고 소스 연결된 작업을 완료하는 데 사용할 수 있는 컨텍스트로 전환합니다.
Grok 4.7 소개
SpaceXAI의 코딩 및 지식 작업을 위한 가장 강력한 모델입니다. 비교 가능한 모델보다 두 배 빠르고 가격은 절반입니다.
호주 청소년 안전 청사진 소개
OpenAI는 청소년을 보호하고 역량을 강화하는 안전한 AI 경험을 위한 6가지 기둥 로드맵인 호주 청소년 안전 청사진을 소개합니다.
Google의 AI 및 경제 팀에 새로운 전문가 합류
녹색 그리드 배경 전체에 'AI 및 경제 연구 프로그램' 텍스트가 표시되고 오른쪽 하단에 Google G 로고가 있습니다.
Google과 함께 패션의 미래를 공동 창작
Jane Wade와 Sergio Hudson
임베디드 평가를 위한 Accenture와의 파트너십
우리는 Accenture와 함께 최첨단 AI의 독립적인 평가를 위해 파트너십을 맺고 있습니다. 이는 최근 Anthropic에 평가자를 임베딩하기로 한 우리의 약속의 일부입니다. 우리와 Accenture 모두 향후 5년간 이 분야의 역량을 구축하기 위해 최소 10억 달러를 투자할 것으로 예상합니다.
Grok 음성 받아쓰기 2.0 소개
SpaceXAI의 최신 음성-텍스트 모델을 발표합니다. 탁월한 정확성과 비용 효율성을 자랑합니다.
Gemini 3.8 Live 및 3.8 Live Extended Thinking 소개
🌎 업계 동향 (13/138건)
AI는 지혜가 없고, 당신도 없을 것이다
분명히 산업은 변화하고 있지만, 더 이상 코드를 읽고 쓰지 않는 함정에 빠지는 사람들과 조직은 스스로 위험을 감수하는 것입니다.
연구: 젊은 사용자(9~18세), 구글 대신 AI 선택…미지의 결과 초래
인공지능 사용이 어린 학생들에게 미치는 영향에 대한 약 200건의 연구를 검토한 결과, 우리가 아는 것이 거의 없다는 사실이 밝혀졌습니다.
Nscale의 IPO, 집중적인 AI 투자에 대한 월스트리트의 의지 재확인할까
영국 AI 데이터 센터 개발업체는 매출의 대부분을 기술 대기업 Microsoft와 Anthropic에 의존하고 있습니다.
Apple 스토어를 구축한 인물, AI 쇼핑에 대한 실리콘밸리의 베팅을 믿지 않다
Apple 스토어 건축가 Ron Johnson은 Apple의 비결은 항상 사람에 있었다고 말합니다.
'DeepSeek보다 낫다': 샤오미의 MiMo-V2.6-Pro, 세계 최고 오픈 웨이트 모델로 데뷔, 더 저렴한 V2.6-Flash와 함께
놀라운 이변으로, 중국 전기차 및 가전제품 제조업체 샤오미가 성장하는 MiMo 언어 모델 제품군의 최신 버전을 출시했으며, MiMo-V2.6-Pro는 제3자 벤치마킹 회사인 Artificial Analysis의 Intelligence Index에서 46점을 기록하며 세계 최고 성능의 오픈 웨이트 모델로 등장했습니다. 더 읽어보기
올여름 AI 과대광고에 속지 마세요
AI 과대광고로 인해 몇 달간 매우 바빴습니다. 4월 말, Anthropic은 자사 모델 Claude Mythos가 대부분의 보안 전문가보다 소프트웨어 취약점을 찾는 데 더 뛰어나다고 주장했습니다. 그런 다음 OpenAI-Hugging Face 해킹 사건이 있었고, 그 후 Anthropic(자랑스럽게)과 Meta(마지못해)는 자사 모델과 관련된 유사한 사건을 공개했습니다. 그 뒤를 이어...
AI 코딩이 CI를 병목 현상으로 만들었기에, 우리는 따라잡기 위해 CI를 재작업했다
우리는 CI를 시스템으로 재고하여, 기반 인프라부터 작업 스케줄링 및 테스트 병렬화 방식까지 개선함으로써 PR 대기 시간과 운영 비용을 절감했습니다.
macOS 27: AI 모델 다운로드 방지 및 저장 공간 절약을 위한 해결책
Hacker News (218점, 댓글 107개)
자체 하드웨어에서 프론티어 AI
수업 중 하나에서 저는 묻기 두려웠지만 답을 꼭 알아야 했던 질문을 했습니다. "졸업 후 취업을 못 할까 봐 두려운 사람?" 방에 있던 150명 중 약 80%가 손을 들었습니다. 이는 대략 120명의 학생들이 동시에, 그들이 [...]라고 답한 것입니다.
캘리포니아, AI 데이터 센터 에너지 및 물 사용 규제 강화
Gavin Newsom 캘리포니아 주지사는 AI 데이터 센터가 유틸리티 비용을 주민들에게 전가하는 것을 방지하기 위한 7개 법안에 서명했습니다. 이 법안 패키지는 캘리포니아 공공 유틸리티 위원회에 데이터 센터에 대한 새로운 요금 분류를 도입하도록 요구하는 동시에 […] 업그레이드 비용을 지불하도록 강제합니다.
메타의 엄청난 권한을 가진 AI 비서 Muse, 심각한 제로데이 취약점 발견
단순한 ClickFix 공격만으로도 새로운 에이전트를 완전히 납치할 수 있습니다.
Microsoft, 인도 클라우드 인프라 전반에 AI 준비 기능 도입
Microsoft, 인도 클라우드 인프라 전반에 AI 준비 기능 도입 이라는 게시물이 Source에 처음 게재되었습니다.
Pirate Face, LLM 모델을 삭제에서 구출
체크섬 검증된 마그넷 링크로서의 오픈 모델. 차단 불가능, 무리에 의해 운반됨.
🛠️ 도구 & 오픈소스 (4/27건)
Transformers, 이제 llama.cpp quants 실행 가능
oMLX 제작자 겸 유지보수 담당자 Jun Kim, MLX 커뮤니티 지원 위해 Hugging Face 합류
Jev, 새로운 형태의 LLM - System One, 즉 Decision Models 출시
지난주 TypeSafe AI는 "System One 모델"이라고 부르는 새로운 범주의 첫 번째 예시인 Jev를 공개했습니다. (저는 Maggie Appleton과 마찬가지로 "decision models"가 이 모델들에 더 나은 이름이라고 생각합니다.) Jev는 일반적인 LLM 형식의 흥미로운 변형입니다. 텍스트 입력을 계속 받지만, 텍스트 출력 대신 범주, 예/아니오 질문, 등급 및 관련 신뢰도 점수에 해당하는 부동 소수점 숫자를 반환합니다. TypeSafe는 Jev를 다음과 같이 설명합니다:
코드를 읽어야 할까, RAG는 끝났는가, Skills가 MCP를 죽였는가?
GitHub 팟캐스트 최신 에피소드에서 이 질문들과 다른 AI 관련 뜨거운 주제들을 다룹니다. 코드를 읽어야 할까, RAG는 끝났는가, Skills가 MCP를 죽였는가? 라는 게시물이 The GitHub Blog에 처음 게재되었습니다.
📚 논문 & 연구 (15/166건)
GameHorizon Suite: 게임 플레이에서의 다중 호라이즌 데이터 및 평가
현대 비디오 게임은 시각적 이해, 지시 분해, 목표 계획 및 여러 시간적 호라이즌에 걸친 정확한 액션 제어 능력을 결합하여 AI 모델을 위한 측정 가능한 테스트베드를 제공합니다. 그러나 기존 데이터셋 및 벤치마크는 게임 범위를 좁게 하거나, 언어 지시가 부족하거나, 높은 분산의 온라인 롤아웃에 의존합니다. 이러한 과제를 해결하기 위해 우리는 다양한 수준에서 게임 플레이 능력을 측정하는 통합 데이터 및 평가 스위트인 GameHorizon을 소개합니다.
WorldCrafter: 암시적 3D 인식 메모리를 갖춘 일관된 비디오 월드 모델
비디오 월드 모델은 동적 환경의 대화형 탐색을 가능하게 하지만, 장기 호라이즌 및 시점 전반에 걸쳐 이전 관찰을 존중하는 데 어려움을 겪습니다. 우리는 이를 위해 카메라 쿼리 가능한 암시적 3D 인식 메모리를 학습하는 비디오 월드 모델인 WorldCrafter를 제시합니다. 핵심 아이디어는 요청된 시점이 다중 뷰 증거가 비디오 생성기의 제한된 토큰 예산에 어떻게 압축되는지를 형성하도록 하는 것입니다. 비디오 생성기와 공동으로 학습된 메모리 인코더 및 포즈 조건부...
DexTacWAM: 민첩한 조작을 위한 시각-촉각 월드-액션 모델
민첩한 조작은 종종 비전에서 부분적으로만 관찰 가능한 접촉 역학에 의존합니다. 최근 월드-액션 모델(WAM)은 예측 비디오 월드 모델링과 액션 생성을 결합하지만, 대부분 비전 중심적이어서 이러한 접촉 역학을 직접 모델링할 수 없습니다. 우리는 각 손가락 끝을 독립적으로 인코딩하고, 손가락 및 포즈 인식 촉각 압축기를 통해 결과 특징을 집계하며, 촉각 잠재적 정보를 주입하는 시각-촉각 WAM인 DexTacWAM을 제시합니다.
Harness-Zero: 에이전트-로서-하네스 증류
에이전트 하네스, 즉 모델-환경 상호 작용을 중재하는 외부 시스템은 에이전트 성능을 크게 향상시킬 수 있지만, 그 이점은 배포 시 하네스에 고정됩니다. 최적의 하네스는 도메인, 인스턴스 및 모델에 따라 다르기 때문에 범용 에이전트는 최적이 아닌 공유 하네스에 만족하거나 점점 더 많은 전문화된 하네스 중에서 라우팅해야 합니다. 따라서 우리는 에이전트 하네스 증류를 연구합니다. 즉, 도메인 또는 인스턴스 최적화 하네스를 훈련 시간 가이드로 사용합니다.
RRSI: 에이전트 하네스의 정규화된 재귀적 자기 개선
LLM 에이전트의 능력은 프롬프트, 제어 흐름, 도구, 메모리 및 고정된 백본 모델을 둘러싼 컨텍스트 관리인 하네스에 의해 크게 증폭됩니다. 최근 방법들은 에이전트 하네스의 구성 요소별 편집을 반복적으로 제안하고 선택함으로써 이 프로세스를 점점 더 자동화하여, 에이전트-시스템 수준에서 사실상의 재귀적 자기 개선(RSI)을 확립합니다. 그러나 이러한 재귀적 진화는 훈련 작업을 기억함으로써 과적합될 수 있으며, 큰 인-
DolphinBench: 에이전트 메모리의 파레토 최전선 매핑
오늘날 에이전트는 종종 장기 메모리 및 시간 경과에 따른 컨텍스트 검색에 의존하는 실제 작업을 수행합니다. 그러나 대부분의 현재 메모리 벤치마크는 대화형 질문-답변 형식을 위해 구축되었으며, 질문 자체가 일부 사실을 검색해야 함을 신호하고 종종 어떤 사실인지를 나타냅니다. 또한, 벤치마크는 제출물에 정확성 이상의 것을 거의 요구하지 않아 메모리 시스템이 더 높은 점수를 달성하기 위해 비합리적인 비용/시간 절충을 할 수 있습니다. 우리는 벤치마크인 DolphinBench를 소개합니다.
Critical-State RL: 다중 턴 도구 사용을 위한 학습 가능한 상태 진단
다중 턴 도구 사용 실패는 단일 모델 호출에 달려 있을 수 있지만, 보상 변동만으로는 어떤 호출이 훈련의 이점을 얻을 수 있는지 알 수 없습니다. 보상이 후속 상호 작용에 의존할 때, 그 변동은 현재 행동 간의 차이가 아닌 다운스트림 무작위성을 반영할 수 있습니다. 우리는 다중 턴 상호 작용에서 학습 가능한 상태를 식별하기 위해 Critical-State RL을 도입합니다. 작업 정의 후보 호출 및 로컬 보상이 주어지면, 이 방법은 각 보상이 행동의 효과를 포착하는지 여부를 평가합니다.
onPanda: 토큰 수준 수정을 통한 LLM 및 에이전트의 온-정책 정렬 데이터 효율적 주석
저희는 LLM 정렬 데이터 및 에이전트 궤적을 효율적으로 주석 처리하기 위한 대화형 도구인 onPanda를 소개합니다. onPanda는 토큰 수준 수정을 핵심 상호작용으로 채택합니다. 주석 작성자는 모델 응답을 읽으면서 첫 번째 부적절한 토큰을 찾아 모델의 후보 토큰 중에서 대체 토큰을 선택하거나 자유 형식 편집을 통해 올바른 텍스트를 입력합니다. 시스템은 해당 위치 이후의 모든 것을 잘라내고 수정된 접두사부터 생성을 계속하며 이 과정을 반복합니다.
효율적인 온디바이스 LLM 생성형 개인화를 위한 LoRA 생성 하이퍼네트워크
모바일 폰 등 온디바이스 대규모 언어 모델(LLM)은 개인화를 통해 개선될 여지가 많습니다. 모바일 기기의 제한된 컴퓨팅 자원은 모델 규모와 품질에 제약을 가하므로, 실현 가능한 품질 향상은 매우 중요합니다. 동시에, 개인적인 특성(즉, 특정 사용자와의 밀접한 연결)은 주어진 온디바이스 LLM이 시간이 지남에 따라 유사하고 예측 가능한 패턴으로 사용되는 경향이 있음을 의미합니다. 본 논문은 새로운 방법을 제시합니다.
JAREX: 다목적 알고리즘 공정 특성화를 위한 획득 함수
제약 공정 특성화는 품질 설계(Quality by Design)의 핵심이며, 공정 매개변수의 변화가 제품 품질 사양 충족 능력에 어떻게 영향을 미치는지 정의하여 입증된 허용 범위와 견고한 제조를 지원합니다. 그러나 실제로는 특성화가 여전히 주로 요인 설계(DOE) 접근 방식에 의존하고 있으며, 이는 고차원 공간에서 다변량 합격/불합격 경계를 해결하는 데 비효율적입니다. 베이지안 최적화가...
불완전한 조상으로부터 물리학 학습
신경 연산자(Neural operators)는 매개변수 편미분 방정식을 저렴하게 평가하지만, 훈련 분포를 벗어나면 성능이 급격히 저하됩니다. 물리 정보 신경망(Physics-informed neural networks, PINN)은 레이블이 지정된 데이터에 대한 의존성을 피하지만, 최적화가 '분지 취약(basin-fragile)'할 수 있습니다. 즉, 지배 잔차가 여러 해를 허용할 때, 처음부터 훈련된 PINN은 작은 잔차를 달성했음에도 불구하고 물리적으로 잘못된 상태로 수렴할 수 있습니다. 우리는 이러한 실패 모
추론의 정확성: 분포 외 일반화를 위한 표현 기준
모델은 훈련 분포 밖에서 일반화될 때, 생성 메커니즘에 맞춰진 근사치가 아니라 구조적으로 동등한 표현을 계산할 때만 가능합니다. 이러한 동등성은 분포 내외의 정확성에 필수적이며, 외삽은 그 실현 방식에 관계없이 추론 시의 이러한 정확성에 의해 좌우됩니다. 텐서 논리(Tensor Logic)는 이를 보여줍니다. 제로 온도 수축은 이산 논리와 동등하며, 추출된 인공물 없이 제자리에서 추론하고, 그 텐서는 부울이며...
해석 가능한 텍스트 함의를 위한 언어적 특징
신경 모델이 자연어 처리에서 성공을 거두었음에도 불구하고, 그들의 블랙박스 특성은 해석 가능성을 제한하고 예측의 기저에 있는 언어 현상을 숨깁니다. 우리는 의미론적 분석의 두 가지 보완적인 계층을 통합하는 텍스트 함의 인식(Recognizing Textual Entailment)을 위한 설명 가능한 하이브리드 모델인 SLITE를 제시합니다. 하나는 구성 요소 간의 의미론적 호환성 및 비호환성에 기반한 구조-관계 계층이고, 다른 하나는 구조에 기반한 분포-정보 계층입니다.
SocioVerse2: 인간-AI 공진화 패러다임 하의 종단적 동적 사회 시뮬레이션 프레임워크
사회 시뮬레이션은 사회 과학에 현실 세계가 제공할 수 없는 실험 도구를 제공하며, 생성형 에이전트는 에이전트 기반 모델링과 실제 행동 데이터를 결합하는 실리콘 샘플 역할을 함으로써 이를 변화시켰습니다. 기존 플랫폼은 집단 행동을 검증하고, 시뮬레이션된 인구를 횡단면에서 실제 사회와 정렬하며, 연구 과정에 자율 에이전트를 활용합니다. 그러나 두 가지 사회 과학 요구 사항은 체계적인 지원 없이 남아 있습니다. 즉, 개입과...
ToneCL: 소수 학습 음절 수준 성조 분류를 위한 대조 학습
성조 언어는 전 세계 언어의 50~70% 이상을 차지하지만, 대다수는 저자원 언어로, 자동 성조 분류에 필요한 대규모 전사 코퍼스가 부족합니다. 기존 데이터셋은 일반적으로 문장 수준에서 수집되는 반면, 현장 언어학자들은 세분화된 음절 수준 주석을 필요로 합니다. 우리는 소수 학습 음절 수준 성조 분류를 위한 경량 대조 학습 프레임워크인 ToneCL을 제안합니다. 우리는 만다린어와 베트남어에서 저자원 조건을 시뮬레이션합니다.
⚖️ 정책 & 안전 (5/12건)
Import AI 473: 미국의 초지능 전략; 생쥐 두개골 속 인간의 뇌; 기계 해석학
지금 우리 방에 있는 AI가 부딪히고 있는 벽인가?
AI 안전성 논의, 믿기 어려울 정도로 변질
이번 주 AI 안전성에 대한 두 가지 논의가 입소문을 타면서 AI의 사실과 허구를 구별하는 것이 얼마나 어려운지 보여주었습니다.
[논문] 문자열학적 시퀀스 예측 III
초록: 이전 논문들(Kosoy 2026a,b)에서 우리는 문자열학적 단어 복잡도 측정에 적응된 시퀀스 예측 알고리즘 연구를 시작했습니다. 특히, 우리는 다항 시간 예측 알고리즘을 허용하는 산술 반복 복잡도(ARC)라는 복잡도 측정치를 정의했으며, 이는 복잡도에 대해 준선형적인 오류 경계를 가집니다. 여기서는 ARC와 관련된 더 약한 복잡도 측정치를 보여주며, 이는 특히 효율적인 예측 알고리즘, 즉 준선형 시간으로 실행되는 알고리즘을 허용합니다.
Gavin Newsom, AI 킬 스위치 추진
Gavin Newsom 캘리포니아 주지사(민주당)는 금요일 발표된 새로운 행정 명령을 통해 최첨단 모델에 대한 "킬 스위치"를 의무화할 가능성을 포함하여 AI 감독을 주도할 수 있도록 주를 포지셔닝하고 있습니다. Newsom의 명령은 주가 두 달 안에 권고안을 제공할 전문가 그룹을 소집하도록 지시합니다. […]
OpenAI, 6건의 새로운 AI 안전 사고 공개
해커 뉴스 (6점, 0 댓글)
🎥 영상 & 튜토리얼 (3/11건)
네, Jev는 미쳤지만 함정이 있습니다
❤️ Lambda를 여기서 확인하고 GPU 클라우드에 가입하세요: https://lambda.ai/papers 📝 Jev: https://typesafe.ai/blog/introducing-system-one-models-and-jev 전체 노래: https://www.youtube.com/watch?v=4RtUJkjrKMI 이전 논문, 구현, 모델: https://huggingface.co/convaiinnovations/laya https://arxiv.org/abs/2503.23303 https://huggingface.co/
이 로봇은 악마처럼 보입니다... 의도적으로?
이 로봇은 판타지 영화 악당처럼 보이지만 의도적으로 그렇게 디자인되었습니다. 외모와 달리 Threehalves 로봇의 디자인은 실제로 완벽하게 말이 됩니다. 네 개의 다리로 안정성을 확보하고, 손목에 직접 부착되는 도구, 그리고 원격 조종사를 위한 카메라를 수용하는 뿔이 있습니다. 목표는 숙련된 작업자가 산불 지역, 무너진 건물, 유독성 환경과 같은 위험한 작업을 안전한 거리에서 처리할 수 있도록 하는 것입니다. 아직 반쯤 만들어진 개념 증명입니다. 하지만 이것은...
전 OpenAI 연구원이 LLM에서 언어를 삭제했습니다...
Mux는 오디오를 번역하고 동영상에 대한 질문에 답하는 비디오 API입니다. $50 상당의 무료 크레딧을 받으세요: https://mux.com/fireship 전 OpenAI 연구원 Diogo Almeida는 2년 동안 은둔하며 Jev를 개발했습니다. "시스템 1" AI 모델인 Jev는 말하거나 코드를 작성할 수는 없지만 200배 더 빠르고, 400배 저렴하며, 환각이 없다고 주장합니다. 자세히 알아보겠습니다. 더 많은 Fireship을 원하시나요? 🗞️ 뉴스레터: https://bytes.dev 🧠 코스: ht