🤖 모델 & 제품 (11/32건)
GPT-6를 위한 향상된 프롬프트 캐싱
GPT-6가 더 높은 캐시 히트율, 새로운 진단, 명시적 중단점 및 지연 시간과 비용을 줄이는 제어를 통해 프롬프트 캐싱을 개선하는 방법을 알아보세요.
GPT-6 Sol 및 Luna 소개
기능과 비용의 다양한 균형을 통해 일상 업무에 최첨단 지능을 제공하는 두 가지 모델, GPT-6 Sol 및 Luna를 만나보세요.
GPT-6 Astra로 연구 시간 및 비용 절반으로 단축
GPT-6 Astra를 통해 Parallel은 이전 모델 대비 절반의 시간과 비용으로 노동 시장 데이터를 연구하고 종합할 수 있었습니다.
효과적인 제3자 평가를 위한 우선순위 및 원칙
OpenAI는 최첨단 모델 및 안전 장치에 대한 엄격하고 안전하며 독립적인 제3자 AI 안전 평가를 위한 우선순위와 원칙을 개괄합니다.
SpaceXAI가 Grok Bot을 활용하여 고객 지원을 확장하는 방법
SpaceXAI는 Grok Bot을 중심으로 SpaceXAI와 Cursor의 통합 지원 운영을 재구축하여, 인력 추가 없이 훨씬 더 광범위한 제품 포트폴리오로 확장했다.
Higgsfield AI, GPT-6 Astra로 하루 만에 새로운 비디오 기능 출시
GPT-6 Astra를 통해 Higgsfield AI는 중소기업을 위한 비디오 광고 제작을 더 쉽게 만들고 새로운 창의적 도구를 더 빠르게 시장에 출시합니다.
수학 및 인공지능 자문 위원회
OpenAI는 새로운 AI 결과의 검토 및 커뮤니케이션을 안내하기 위해 독립적인 수학 및 인공지능 자문 위원회와 협력하고 있습니다.
Grok 4.7 소개
코딩 및 지식 작업에 최적화된 SpaceXAI의 가장 강력한 모델. 유사 모델 대비 2배 빠르고 가격은 절반이다.
Google AI & 경제 팀에 새로운 전문가 합류
초록색 격자 배경에 'AI & Economy Research Program' 텍스트가 가득하며, 오른쪽 하단에 Google G 로고가 있습니다.
액센츄어와 협력하여 임베디드 평가 진행
Anthropic은 액센츄어와 협력하여 최첨단 AI의 독립적인 평가를 진행한다. 이는 Anthropic에 평가자를 배치하겠다는 최근 약속의 일환이다. 양사는 향후 5년간 이 분야 역량 구축에 최소 10억 달러를 투자할 예정이다.
Gemini 3.8 Live 및 3.8 Live Extended Thinking 소개
🌎 업계 동향 (12/165건)
TechCrunch Founder Summit 일정 공개: 보스턴에서 11월 4일 펀딩, 채용, AI 인사이트 확보
창업자는 어려운 교훈을 힘들게 배울 필요가 없습니다. TechCrunch Founder Summit은 회사 설립의 어려움을 덜어주고 성공의 기쁨을 더욱 크게 만들기 위해 마련되었습니다.
OpenAI, 다시 한번 실수하지 않기 위해 엘리트 수학자들과 협력한다
일련의 놀라운 수학적 결과들을 평판 위기로 몰고 간 후, OpenAI는 더 재앙적인 경로를 피하기 위해 인간 수학자들과 협력하고 있습니다. 월요일, 이 회사는 수학 연구 및 더 넓은 분야와의 상호 작용에 대해 자사와 다른 AI 회사들에 조언할 임무를 맡은 새로운 독립 수학자 패널을 발표했습니다. [...]
Claude Opus 5.5
Claude Opus 5.5 leads in agentic coding and knowledge work, and costs 40% less to run than Opus 5 on typical workloads.
GPT-6 Sol and Luna
Meet GPT-6 Sol and Luna, two models that bring frontier intelligence to everyday work with different balances of capability and cost.
OpenAI GPT–6 Astra breaks Enigma message that has resisted solution since 2005
Hacker News (551 points, 357 comments)
국방부, AI 과도한 의존이 이란 학교 미사일 공격에 기여했다고 밝혀
해커 뉴스 (390점, 댓글 207개)
OpenAI, Jev를 빠르게 추격할 유리한 위치에 있어
TypeSafe의 Jev는 생성된 텍스트 대신 보정된 확률로 즉각적인 판단을 내리는 진정한 돌파구입니다. 제 생각에 OpenAI는 이미 이를 복사하여 Jev가 따라올 수 없는 자체 모델 내에 통합하는 방법을 모색하고 있을 것입니다.
Claude Opus 5.5 Intelligence, Performance and Price Analysis (Max)
Analysis of Anthropic's Claude Opus 5.5 (Adaptive Reasoning, Max Effort, Default Fallback) and comparison to other AI models across key metrics including quality, price, performance (tokens per second & time to first token), context window & more.
Microsoft, 12,000개 계정 침해한 AI 지원 플랫폼 방해
EvilTokens는 대규모 침해를 더 빠르고 쉽게 만드는 엔드투엔드 플랫폼을 제공했습니다.
텍스트 핸드오프는 AI 모델을 느리게 합니다. C2C는 대신 KV 캐시를 통해 통신할 수 있습니다.
다중 LLM 시스템이 텍스트를 통해 한 모델에서 다른 모델로 작업을 전달할 때(라우터가 모델 간 전환하거나 에이전트가 작업 협업), 첫 번째 모델은 자신이 아는 것을 텍스트로 압축해야 하고, 다음 모델은 해당 텍스트를 읽고 포함된 정보를 재구성해야 합니다. 해당 핸드오프는 정보를 손실하고 추론 시간을 추가할 수 있습니다. 더 읽기
EvilTokens 교란: AI 기반 사이버 범죄 플랫폼 해체
AI 기반 사이버 범죄 플랫폼인 EvilTokens를 해체한 사례를 다룹니다.
올여름 AI 과대광고에 속지 마세요
최근 몇 달간 AI 과대광고가 많았습니다. 4월 말 Anthropic은 자사 모델 Claude Mythos가 대부분의 보안 전문가보다 소프트웨어 취약점을 더 잘 찾아낸다고 주장했습니다. 이후 OpenAI-Hugging Face 해킹 사건이 있었고, Anthropic(자랑스럽게)과 Meta(마지못해)는 자사 모델과 관련된 유사한 사건들을 공개했습니다. 이어서...
🛠️ 도구 & 오픈소스 (5/26건)
영국 AISI와 EvalEval이 벤치마크 결과 재현성을 높이는 방법
Transformers, 이제 llama.cpp 양자화 모델 실행 지원
oMLX 개발자이자 관리자인 김준, MLX 커뮤니티 지원 위해 Hugging Face 합류
Jev, 새로운 형태의 LLM - System One, 즉 Decision Models 출시
지난주 TypeSafe AI는 "System One 모델"이라고 부르는 새로운 범주의 첫 번째 예시인 Jev를 공개했습니다. (저는 Maggie Appleton과 마찬가지로 "decision models"가 이 모델들에 더 나은 이름이라고 생각합니다.) Jev는 일반적인 LLM 형식의 흥미로운 변형입니다. 텍스트 입력을 계속 받지만, 텍스트 출력 대신 범주, 예/아니오 질문, 등급 및 관련 신뢰도 점수에 해당하는 부동 소수점 숫자를 반환합니다. TypeSafe는 Jev를 다음과 같이 설명합니다:
코드를 읽어야 할까? RAG는 끝났을까? Skills가 MCP를 대체했을까?
GitHub 팟캐스트 최신 에피소드에서 이러한 질문들과 다른 AI 관련 뜨거운 논쟁들을 다룹니다.
📚 논문 & 연구 (8/175건)
TimeInteract: 스트리밍 시계열을 위한 실시간 상호작용 지능을 향하여
실제 시계열은 지속적으로 진화하며 언제든지 의미 있는 변화가 나타날 수 있다. 그러나 기존 시계열 언어 모델(TSLM)은 본질적으로 정적이다. 이들은 오프라인 처리를 위해 완전한 시퀀스를 받거나 스트리밍 입력과 응답 생성을 번갈아 수행하여 상호작용 중 새로운 관측치를 처리하지 못한다. 우리는 새로운 패러다임인 시계열 상호작용(Time-Series Interaction)을 소개한다. 이 모델은 들어오는 시계열 관측치와 사용자 입력을 지속적으로 인지한다.
MAVP: 모바일 조작을 위한 지도 인식 시각 운동 정책
성공적인 모바일 조작은 정확한 공간 위치를 유지하면서 베이스와 암의 조율된 움직임을 필요로 한다. 그러나 시연 학습된 정책은 의도한 베이스 움직임을 안정적으로 구현하는 데 어려움을 겪어 공간 불일치 및 조작 실패로 이어진다. 우리는 명시적인 베이스 포즈 목표를 예측하고 위치 피드백을 사용하여 이를 추적함으로써 실행 신뢰성을 향상시키는 프레임워크인 MAVP(Map-Aware Visuomotor Policies)를 제시한다.
FairMean: 레이블 오염 공격 하 분산 학습의 공정성 증진
공정성 인식 분산 학습은 성능 격차를 줄이기 위해 큰 손실을 가진 클라이언트를 우선시하지만, 레이블 오염은 큰 손실을 유발하여 공정성-강건성 충돌을 야기할 수 있다. 우리는 이 충돌을 관리하기 위해 FairMean을 제안한다. FairMean은 로컬 손실의 유계 비감소 함수를 사용하여 클라이언트 기울기에 가중치를 부여한다. 증가하는 가중치는 높은 손실 클라이언트를 우선시하여 공정성을 증진하는 반면, 상한은 오염된 클라이언트 기울기의 과도한 손실 유발 증폭을 방지한다.
GitScholar: GitHub 참여를 통한 AI 연구 영향력 예측 데이터셋
AI 연구의 빠른 발전과 매일 수백 건의 새로운 논문이 발표되는 상황에서 최신 동향을 파악하는 것은 점점 더 어려워지고 있습니다. 연구자들에게 영향력 있는 작업을 신속하게 식별하는 것이 필수적이지만, 각 새로운 논문을 수동으로 검토하는 것은 비현실적입니다. 자동화된 영향력 예측 방법은 일반적으로 논문의 내용이나 인용 기록과 같은 다양한 정보원을 결합하여 이 문제를 해결하는 데 도움을 줍니다. 본 연구에서는 GitHub 참여를 활용한...
PACT: Credit Assignment에서 Critic Alignment까지
강화 학습은 대규모 언어 모델(LLM)의 후처리 과정에서 핵심 구성 요소가 되었지만, 토큰 수준의 credit에 대한 보편적으로 합의된 수학적 정의가 부족하여 일반적으로 사용되는 학습 신호와의 관계가 불분명합니다. 우리는 Completeness, Prefix Consistency, Neutrality라는 세 가지 정규성 조건을 공식화하고, 이 조건들이 토큰 수준의 credit을 고유하게 결정함을 증명합니다. 이 특성화는 기존 알고리즘 전반의 현상을 설명하는 통일된 기반을 제공합니다.
TransBERT: 도메인 특화 언어 모델링을 위한 합성 번역 프레임워크
특수 도메인에서 영어 외 언어 데이터의 부족은 효과적인 자연어 처리(NLP) 도구 개발을 크게 제한합니다. 우리는 전적으로 합성 번역 텍스트를 사용하여 언어 모델을 사전 학습하는 새로운 프레임워크인 TransBERT를 제시하고, 확장 가능한 번역 툴킷인 TransCorpus를 소개합니다. 프랑스어 생명 과학 도메인에 초점을 맞춘 우리의 접근 방식은 다양한 다운스트림 작업에서 최첨단 성능을 달성할 수 있음을 보여줍니다.
Critical-State RL: 다중 턴 도구 사용을 위한 학습 가능한 상태 진단
다중 턴 도구 사용 실패는 단일 모델 호출에 달려 있을 수 있지만, 보상 변화만으로는 어떤 호출이 학습으로부터 이익을 얻을지 알 수 없습니다. 보상이 후속 상호 작용에 의존할 때, 그 변화는 현재 행동 간의 차이보다는 후속 무작위성을 반영할 수 있습니다. 우리는 다중 턴 상호 작용에서 학습 가능한 상태를 식별하기 위해 Critical-State RL을 도입합니다. 작업 정의 후보 호출 및 로컬 보상이 주어졌을 때, 이 방법은 각 보상이 행동의 효과를 포착하는지 평가합니다.
Harness-Zero: Harness Distillation via Agent-as-Harness
Agent harnesses, the external systems that mediate model-environment interaction, can substantially improve agent performance, but their gains remain tied to the harness at deployment. Because the best harness varies across domains, instances, and models, a general-purpose agent must either settle f
⚖️ 정책 & 안전 (5/12건)
모든 창업자가 TechCrunch Disrupt 2026 일정에 포함해야 할 5가지 AI 안전 세션
TechCrunch Disrupt 2026에서는 AI 스테이지와 Real World AI 스테이지 전반에 걸쳐 Anthropic, Nvidia, AWS, Waabi 등의 리더가 참여하는 5가지 AI 안전 세션이 진행됩니다. 9월 25일 이전에 등록하면 최대 200달러를 절약할 수 있습니다.
Import AI 473: The US's superintelligence strategy; human brain in a mouse skull; and machine hermeneutics
Is the wall AI is hitting in the room with us right now?
[Paper] Stringological sequence prediction III
Abstract: In previous papers (Kosoy 2026a,b), we began the study of sequence prediction algorithms adapted to stringological word complexity measures. In particular, we defined a complexity measure called Arithmetic Repetition Complexity (ARC) which admits a polynomial-time prediction algorithm with
Gavin Newsom, AI 킬 스위치 추진
Gavin Newsom 캘리포니아 주지사(민주당)는 금요일 발표된 새로운 행정 명령을 통해 최첨단 모델에 대한 "킬 스위치"를 의무화할 가능성을 포함하여 AI 감독을 주도할 수 있도록 주를 포지셔닝하고 있습니다. Newsom의 명령은 주가 두 달 안에 권고안을 제공할 전문가 그룹을 소집하도록 지시합니다. […]
OpenAI, 6건의 새로운 AI 안전 사고 공개
해커 뉴스 (6점, 0 댓글)
🎥 영상 & 튜토리얼 (3/12건)
Opus 5.5 Is Crazy Good and GPT-6-Sol Launched Too
Two new models in the same day?? Claude and ChatGPT. Discover More: 🛠️ Explore AI Tools & News: https://futuretools.io/ 📰 Weekly Newsletter: https://futuretools.io/newsletter Socials: ❌ Twiter/X: https://x.com/mreflow 🖼️ Instagram: https://instagram.com/mr.eflow 🧵 Threads: https://www.threads.ne
Jev는 놀랍지만, 한 가지 문제가 있습니다
Lambda GPU 클라우드 가입 및 Jev 관련 논문, 구현, 모델 등 자세한 정보를 확인하세요.
전 OpenAI 연구원, LLM에서 언어를 제거하다...
Mux 비디오 API를 통해 오디오 번역 및 비디오 질문 답변 가능. 전 OpenAI 연구원 Diogo Almeida가 2년간 비밀리에 개발한 'System 1' AI 모델 Jev는 대화나 코드 작성이 불가능하지만, 200배 빠르고 400배 저렴하며 환각 현상이 없다고 주장한다.